Nhà tâm lý Daniel Kahneman chia suy nghĩ làm hai kiểu. Kiểu 1 là phản xạ: nhìn một tin nhắn là biết nó gấp hay không. Kiểu 2 là ngẫm nghĩ: viết đề án, cân nhắc phương án.
ChatGPT và Claude thuộc kiểu 2 — giỏi viết, giỏi lý luận, nhưng chậm và đắt. Jev là kiểu 1: chỉ phán đoán nhanh, không viết được câu nào. TypeSafe gọi đây là một loại model mới, System One model.
Đúng hay sai
“Khách này đang đòi hoàn tiền?” — trả về mức khả năng đúng, ví dụ 0,88.
Chọn một
“Tin này thuộc phòng nào?” — chọn một trong danh sách bạn đưa, tối đa 255 mục.
Chấm điểm
“Khách bực đến mức nào?” — chấm trên thang do bạn đặt, ví dụ bình thường · khó chịu · rất giận.
Dành cho team kỹ thuật — một lần gọi Jev trông như thế nào
Một request gồm state (dữ liệu thô) và questions (các câu hỏi). Mọi câu hỏi được chấm độc lập và song song, nên hỏi thêm gần như không làm chậm. Tính tiền theo token đầu vào; token đầu ra miễn phí.
from typesafe_sdk import TypeSafeClient, Choice, Score, Noul client = TypeSafeClient() res = client.system_one( state={"ticket": { "kenh": "Zalo OA", "noi_dung": "Đặt bàn tối qua bị trừ tiền 2 lần, gọi hotline không ai nghe.", }}, questions={ "phong_ban": Choice( instructions="Đội nào nên xử lý ca này", criteria={ "thanh_toan": "Sai tiền, hoàn tiền, hoá đơn", "van_hanh": "Chất lượng món, phục vụ tại chi nhánh", "ky_thuat": "Lỗi app, lỗi đặt bàn", }, ), "muc_buc": Score( instructions="Mức độ bực bội của khách", criteria=["Bình thường", "Khó chịu", "Rất giận"], ), "doi_hoan_tien": Noul( instructions="Khách đang yêu cầu hoàn tiền", ), }, ) res.answers["phong_ban"].choice # "thanh_toan" res.answers["phong_ban"].confidence # 0.93 res.answers["muc_buc"].score # 1.74 res.answers["doi_hoan_tien"].noul # 0.88
+Nhanh tới mức khách không kịp chờ
Nửa giây, so với 10–38 giây của các AI viết chữ. Nghĩa là quyết định có thể nằm ngay trong lúc khách bấm nút, không phải đẩy sang việc chạy nền rồi xử lý sau.
+Rẻ tới mức chạy được trên toàn bộ dữ liệu
Khoảng 0,7 đồng cho một quyết định. Việc trước đây chỉ dám làm trên mẫu 5% thì nay chạy hết 100% — và đó mới là chỗ tạo ra khác biệt thật.
+Nó nói thật mức độ chắc chắn
Mỗi câu trả lời kèm một con số confidence. Bạn đặt luật: dưới 0,5 thì người xem, trên 0,85 thì máy tự làm. Rủi ro thành một cái núm vặn được, thay vì cảm tính.
+Không bao giờ trả lời ngoài danh sách
Nó chỉ chọn trong các mục bạn đưa, nên không có chuyện bịa ra một phòng ban không tồn tại. Đội kỹ thuật bớt được cả mảng code chữa cháy khi AI trả về linh tinh.
AI viết chữ cũng có thể nói “tôi khá chắc chắn”, nhưng đó chỉ là câu chữ — nói cho hay. Jev được huấn luyện riêng để con số đó khớp thực tế: nói 0,9 thì đúng khoảng 90% số lần.
Khi con số đáng tin, bạn mới dám viết luật dựa trên nó. Đó là khác biệt giữa “AI hỗ trợ” và “AI tự chạy có kiểm soát”.
−Không giải thích được vì sao
Bạn nhận một con số, không có một chữ lý do nào. Ở ngân hàng, bảo hiểm, tuyển dụng — nơi khách có quyền hỏi “tại sao hồ sơ của tôi bị từ chối” — đây là rào cản thật, không chỉ là bất tiện.
−Không biết tính toán
Đếm, cộng trừ, so sánh ngày tháng đều không đáng tin. Phần số má phải để phần mềm làm, Jev chỉ lo phần phán đoán.
−Đưa dữ liệu thừa là nó sai nhiều hơn
Ngược với thói quen “cứ đưa hết cho AI tự lọc”. Ở đây phải lọc trước rồi mới đưa vào, nếu không độ chính xác tụt.
−Có thể bị khách lái
Người ngoài viết tin nhắn khéo léo có thể đẩy lệch kết quả phân loại. Đừng để một câu hỏi duy nhất quyết định chuyện liên quan tới tiền.
−Chỉ chính xác ở mức tầm trung
Trong phép đo của chính TypeSafe: Jev đúng 67,8%, còn Claude Opus 5 và GPT-5.6 Sol đúng khoảng 73–74%. Đổi khoảng 6 điểm chính xác lấy tốc độ gấp trăm lần — hợp lý cho việc phân loại hàng loạt, không hợp lý cho một quyết định lớn chạy một lần.
| Tiêu chí | ChatGPT / Claude | Jev | Phần mềm luật cứng |
|---|---|---|---|
| Trả về cái gì | Văn bản — viết được mọi thứ | Một lựa chọn, một điểm số, kèm mức tự tin | Kết quả cố định theo luật đã viết |
| Nhanh cỡ nào | 2–38 giây | Dưới nửa giây | Tức thì |
| Tiền cho 1.000 lần | ~800.000đ | ~700đ | Gần như 0 |
| Hiểu tiếng người không | Có, rất tốt | Có, đủ cho việc phân loại | Không |
| Giải thích được không | Có, nhưng lý do có thể là bịa | Không | Có — luật chính là lý do |
| Hợp với việc gì | Việc cần viết, cần suy luận | Phán đoán lặp đi lặp lại, số lượng lớn | Luật rõ ràng, không cần hiểu ngữ cảnh |
Chia 8.000 tin nhắn mỗi ngày về đúng phòng
Tin từ Zalo, fanpage, sàn, hotline đổ về một chỗ. Mỗi tin được hỏi năm câu cùng lúc: thuộc phòng nào, khách bực đến đâu, có đòi hoàn tiền không, có nhắc đối thủ không, có gấp không. Chưa tới nửa giây là tin nằm đúng hàng đợi.
Điều thay đổi thật: việc này chạy trên toàn bộ tin nhắn, nên ca gắt được đẩy lên đầu ngay phút đầu thay vì phát hiện sau ba tiếng.
Duyệt hoàn tiền theo ba mức
Luật do bạn đặt, Jev chỉ đưa con số: tự tin thấp → nhân viên xử lý. Tự tin vừa → để AI viết thư trả lời rồi người duyệt. Tự tin cao và đơn dưới 500.000đ → duyệt tự động.
Bắt buộc kèm một việc: lưu lại tình huống và con số của từng ca. Jev không giải thích, nên hồ sơ lưu là thứ duy nhất bạn có khi cần rà lại.
Chấm 12.000 lead mỗi tháng
Thay vì hỏi “lead này tốt không” — câu hỏi quá mơ hồ — tách thành bốn câu riêng: đúng ngành không, ngân sách cỡ nào, người liên hệ có quyền quyết không, có đang gấp không. Trọng số do bạn đặt.
Quý này muốn ưu tiên ngành sản xuất? Sửa một con số trọng số, không phải sửa cách hỏi AI rồi cầu may.
Trạm gác trước khi nội dung tới khách
Mỗi email, bài đăng, tin trả lời do AI viết đi qua Jev trước khi gửi: có lộ thông tin nội bộ không, có hứa sai chính sách không, giọng có đúng brand không.
Đây là chỗ hời nhất: dùng một AI rẻ hơn hàng trăm lần để canh một AI đắt tiền, chậm đi khoảng một phần mười giây.
| Bộ phận | Câu hỏi đặt cho Jev | Máy làm gì tiếp |
|---|---|---|
| Chăm sóc khách | Tin này thuộc phòng nào? Khách bực tới mức nào? | Đẩy vào đúng hàng đợi, ca gắt lên đầu danh sách |
| Chăm sóc khách | Khách có đang doạ bỏ đi hoặc doạ đăng bài không? | Nhắn thẳng cho quản lý trong vòng một phút |
| Bán hàng | Lead này có đúng ngành mình nhắm không? Người liên hệ có quyền quyết không? | Chấm điểm, chia cho sale phù hợp, phần còn lại vào nuôi dưỡng |
| Bán hàng | Sau cuộc gọi: khách đang quan tâm, đang cân nhắc hay đã từ chối? | Tự cập nhật trạng thái trên CRM, hẹn lịch gọi lại |
| Marketing | Bình luận này là khen, chê, hỏi giá hay spam? | Trả lời mẫu, ẩn spam, đẩy người hỏi giá sang sale |
| Kế toán | Dòng chi này thuộc khoản mục nào? | Gắn mã sẵn, dòng nào máy không chắc thì kế toán xem tay |
| Kế toán | Chứng từ khách gửi là hoá đơn, biên lai hay hợp đồng? | Xếp vào đúng thư mục, tạo phiếu chờ xử lý |
| Nhân sự | Hồ sơ này có đủ ba tiêu chí bắt buộc của vị trí không? | Lọc vòng đầu, người chỉ đọc hồ sơ đã qua lọc |
| Nhân sự | Phản ánh nội bộ này có dấu hiệu nghiêm trọng không? | Chuyển thẳng cấp quản lý cao hơn, không để trôi |
| Vận hành | Sự cố vừa báo thuộc nhóm nào, có chặn sản xuất không? | Tạo phiếu cho đúng đội, gắn mức ưu tiên |
| Bán lẻ · F&B | Đánh giá 1 sao này nói về món ăn, phục vụ hay giao hàng? | Gửi đúng chi nhánh và đúng bộ phận, kèm thống kê tuần |
| Giao nhận | Khiếu nại này do giao trễ, đóng gói hỏng hay sai hàng? | Mở đúng quy trình bồi thường, không hỏi lại khách |
| Bất động sản · Dịch vụ | Tin nhắn này là khách thật hay môi giới chào mời? | Lọc trước khi chia cho sale, đỡ tốn người gọi |
| Pháp chế · Rủi ro | Nội dung sắp gửi có hứa gì ngoài chính sách công ty không? | Chặn lại, bắt người duyệt trước khi gửi đi |
01Qua người đang làm automation
Các công cụ nối phần mềm phổ biến — n8n, Make, Zapier, hay cả Google Apps Script — đều gọi được API. Ai đang dựng luồng tự động cho công ty bạn là làm được. Việc đầu tiên thường xong trong vài ngày.
02Qua hạ tầng sẵn có
Jev đã có mặt trên Cloudflare. Nếu website hoặc app của công ty đang chạy ở đó, đây là bật thêm một dịch vụ, không phải ký thêm một nhà cung cấp mới.
03Qua đội phần mềm hoặc đối tác
Nếu đã có CRM, phần mềm bán hàng hay tổng đài, chỉ cần chèn vào đúng một chỗ: ngay khi dữ liệu vừa vào, trước khi có người đụng tới.
Phía business cần chuẩn bị bốn thứ
- Chọn đúng một việc lặp lại nhiều nhất và đếm được số lần mỗi ngày — đừng làm năm việc một lúc
- Viết ra danh sách đáp án, kèm mô tả từng mục — chính là cách công ty đang chia việc hiện nay
- Lấy 200–500 ca cũ đã có kết quả để đo thử xem máy đúng bao nhiêu phần trăm
- Đặt ngưỡng và chạy song song hai tuần: máy quyết, người vẫn quyết, cuối tuần so hai bên rồi mới cho chạy thật
Luật và số má
Những gì đúng sai rõ ràng: tính tiền, kiểm tra quyền, chạy vòng lặp.
Phán đoán nhanh
Phân loại, chia việc, chấm điểm — chỗ luật cứng không diễn đạt nổi.
Khi cần câu chữ
Soạn thư, tóm tắt, phân tích ca lạ. Chỉ chạy trên phần nhỏ còn lại.
Ca khó và ca rủi ro
Quyết định cuối, đồng thời là nguồn để đo lại chất lượng hằng tháng.
01Chặn trước cửa
Jev phân loại trước, LLM chỉ chạy trên phần thật sự cần viết chữ. Đây là chỗ cắt được nhiều tiền nhất: phần lớn lượt gọi LLM hiện nay chỉ để lấy về một phán đoán một chữ.
02Chọn model theo độ khó
Jev chấm ca này dễ hay khó, rủi ro cao hay thấp — rồi hệ thống tự quyết dùng model rẻ hay model đắt. Chất lượng giữ nguyên ở ca khó, tiền giảm ở ca dễ.
03Lọc dữ liệu trước khi hỏi LLM
Chỉ đưa phần liên quan vào câu hỏi. Prompt ngắn lại thì vừa rẻ hơn vừa chính xác hơn — LLM càng nhiều dữ liệu thừa càng dễ lạc đề.
04Gác đầu ra
Mọi nội dung LLM viết ra đều bị soi trước khi gửi. Rẻ tới mức bật được cho 100% nội dung, thay vì chỉ kiểm tra ngẫu nhiên vài phần trăm như hiện nay.
05Chấm chất lượng toàn bộ
Trước đây muốn biết AI trả lời tốt hay không, phải dùng chính một LLM đắt tiền đi chấm, nên chỉ dám chấm mẫu 2–5%. Giờ chấm hết — chất lượng thành con số hằng tuần, tụt là biết ngay.
06Cắt vòng lặp của AI agent
Agent đang hỏi LLM ở mọi ngã rẽ: làm tiếp hay dừng, gọi công cụ nào, đã xong chưa. Chuyển các ngã rẽ đó sang Jev thì agent chạy nhanh hơn nhiều lần, ít trôi và ít đốt tiền vào những bước suy nghĩ thừa.
| Chỉ số | Chỉ dùng LLM | Jev đứng trước, LLM đứng sau |
|---|---|---|
| Số lượt gọi LLM / ngày | 8.000 — mọi ca | 1.600 — chỉ ca cần viết chữ |
| Tiền model / ngày | ~6,2 triệu đ | ~1,3 triệu đ |
| Tiền model / tháng | ~187 triệu đ | ~38 triệu đ |
| Thời gian phân loại một ca | 4–10 giây | Dưới 0,5 giây |
| Lỗi cấu trúc phải chạy lại | Có — phải viết code xử lý | Gần như không, ở tầng phân loại |
| Tỉ lệ ca được chấm chất lượng | Mẫu 2–5% | 100% |
| Ca chạy tự động không cần người | Ít — không có con số đáng tin để đặt ngưỡng | Phần ca có mức tự tin cao |
Tiềm năng khi hệ thống được xếp lại
- Chi phí AI trên mỗi đơn hàng, mỗi ticket, mỗi khách giảm một bậc. Những sản phẩm AI trước đây tính ra âm biên — gói giá rẻ, khách nhỏ, thị trường nhạy giá — nay có thể dương. Đây là thay đổi về mô hình kinh doanh, không phải về công nghệ.
- AI chuyển từ chạy nền sang chạy ngay trước mặt khách. Đối thủ dùng LLM thuần mất 10–30 giây nên buộc phải trả lời sau; bạn trả lời trong lúc khách còn trên màn hình. Cùng một tính năng, cảm nhận khác hẳn.
- Tăng trưởng không kéo theo tăng người tuyến tính. Ca dễ chạy tự động theo ngưỡng, người chỉ xử lý ca khó. Gấp đôi đơn hàng không còn đồng nghĩa với gấp đôi nhân sự vận hành.
- Dám đưa AI ra trước mặt khách. Có trạm gác chạy trên 100% nội dung với chi phí không đáng kể, rủi ro thương hiệu nằm trong tầm kiểm soát — thay vì giữ AI trong nội bộ cho an toàn.
- Bớt phụ thuộc một nhà cung cấp. Khi phần phán đoán tách khỏi prompt của một model cụ thể, đổi LLM về sau là thay một tầng, không phải viết lại cả hệ thống. Vị thế đàm phán khác đi.
- Chất lượng thành con số, không còn là cảm nhận. Chấm 100% mỗi tuần thì ban lãnh đạo có cái để quyết: mở rộng chỗ nào, siết chỗ nào, chỗ nào còn phải để người làm.
01Dấu vết để giải trình
Không cần nó viết lý do — chỉ cần chỉ ra phần nào trong tình huống khiến nó nghiêng về đáp án đó. Đủ để dựng hồ sơ khi khách hoặc cơ quan quản lý hỏi.
02Biết tính toán và hiểu ngày tháng
Nếu bản sau làm được, cả mảng tài chính — đối chiếu, phát hiện bất thường — mở ra ngay.
03Học được cách phân loại riêng của công ty
Hiện chưa nạp lại được kết quả thực tế để nó khớp dần với cách bạn chia việc. Đây là ranh giới giữa một công cụ dùng tạm và một hạ tầng dùng lâu.
04Cam kết về phiên bản và giá
Mỗi lần đổi phiên bản là các ngưỡng phải đo lại. Cần lộ trình rõ ràng, cộng với số liệu do bên thứ ba kiểm chứng.
Nên dùng
- Việc lặp lại hàng nghìn lần mỗi ngày
- Câu trả lời nằm trong danh sách liệt kê được trước
- Cần xong dưới một giây, ngay trong lúc khách đang chờ
- Việc trước đây bỏ qua vì không đáng tiền
- Canh nội dung do AI viết trước khi gửi khách
Không nên dùng
- Việc cần viết ra câu chữ cho người đọc
- Quyết định phải giải thích được cho khách hoặc cơ quan quản lý
- Việc cần tính toán, đếm, so sánh ngày tháng
- Quyết định lớn, chạy một lần, không lặp lại
- Chạy tự động mà không có ngưỡng, không lưu vết, không ai rà