Mình vừa đọc thông báo của OpenAI về Decisions API, và con số 10x cho thấy API này nhắm vào các tác vụ cần câu trả lời nhanh, có dạng rõ ràng. Sản phẩm đang ở beta công khai, hiện chỉ có một model hỗ trợ và nhận được text, image hoặc cả hai.
Decisions API có gì mới
Tài liệu ghi API trả về câu trả lời nhanh hơn Responses API khoảng 10x. Nó tập trung vào ba kiểu kết quả: xác suất một điều kiện đúng, một lựa chọn trong nhóm có sẵn, hoặc điểm số dựa trên các mức đã sắp xếp.
Anh em dùng predicate khi cần kiểm tra một điều kiện. Ví dụ, app có thể xem ảnh sản phẩm có vết nứt, vết rách hoặc vết móp hay không, rồi trả xác suất để chuyển trường hợp đáng ngờ cho người kiểm tra.
Choice hợp với nhóm không có thứ tự, chẳng hạn chọn phòng ban xử lý khiếu nại. Score hợp với các mức có thứ tự như độ nghiêm trọng, vì kết quả dùng xác suất của từng mức để tính ra một điểm có thể nằm giữa hai mức.
Một request gồm model, input và questions. Mỗi question có type, hướng dẫn, tên riêng và các lựa chọn hoặc mức điểm nếu cần, còn response trả về một mảng answers để app đọc từng kết quả theo tên đã đặt.
Hiện sản phẩm chỉ chạy với gpt-6-luna và dùng endpoint riêng. Anh em có thể thử câu hỏi cùng input trong Playground trước khi viết code, cách này giúp phát hiện nhãn bị chồng lên nhau hoặc câu hỏi quá mơ hồ.
Anh em dùng nó vào việc gì
Founder có thể dùng nó để đẩy ticket vào đúng team. Marketer có thể phân loại phản hồi, còn dev có thể dùng kết quả để quyết định bước tiếp theo trong một workflow.
Mình thấy cách này hợp với việc lặp đi lặp lại. Anh em đưa vào một nội dung, đặt câu hỏi rõ ràng, rồi dùng nhãn hoặc xác suất để chuyển nội dung sang bước xử lý tiếp theo.
Một app bán hàng có thể hỏi ảnh sản phẩm có lỗi nhìn thấy được hay không. Một hệ thống chăm sóc khách hàng có thể chọn billing, technical hoặc shipping theo nhóm mà anh em định nghĩa trong request.
Sản phẩm này không thay thế mọi cách lấy dữ liệu có cấu trúc. Khi anh em cần một object theo JSON schema riêng, tài liệu hướng sang Structured Outputs với Responses API. Khi anh em cần model yêu cầu một công cụ chạy với tham số, cách gọi hàm phù hợp hơn.
Ảnh phải đi vào request dưới dạng base64 data URL. Endpoint chưa nhận HTTP image URL hoặc file_id, nên hệ thống lấy ảnh từ storage phải encode ảnh trước khi gửi.
Cộng đồng Hacker News phản ứng
Trong luồng thảo luận trên Hacker News, một người bình luận nói OpenAI làm loại API này đúng như dự đoán của cộng đồng. Người đó cũng chú ý tới khả năng xử lý voice, dù tài liệu mình đọc ở đây tập trung vào text và image.
Một ý kiến khác thích việc sản phẩm nhận ảnh. Người bình luận này xem đó là khoảng trống họ từng thấy ở Jev, nhưng đây vẫn là nhận xét cá nhân chứ chưa phải kết luận chung về chất lượng.
Một người bình luận đặt câu hỏi về calibration. Họ muốn biết xác suất 90% có thật sự tương ứng với việc đúng khoảng chín trên mười lần hay không. Tài liệu mình đọc chưa đưa ra benchmark riêng cho calibration.
Có người nghi ngờ giá trị của một dịch vụ quyết định riêng, vì model nhỏ chạy local có thể làm việc tương tự với chi phí thấp hơn. Đây là ý kiến của người bình luận, không phải thông tin về giá hay hiệu năng đã được hãng xác nhận.
Một thành viên nói họ đã thử chưa tới 600 lần gọi trên các bài toán chọn UI và phân loại dữ liệu. Người này ghi nhận độ trễ 346ms ở p50 và 860ms ở p95 trong bộ kiểm tra riêng, rồi nhận xét sản phẩm chậm hơn Jev.
Người đó cũng nói chi phí trung bình cao hơn Jev 3,1 lần và có vài lần gọi lỗi. Mình chưa xem đây là benchmark chung, vì chính bình luận cũng nói bộ bài toán của họ khá riêng.
Điều anh em vẫn cần kiểm tra
OpenAI ghi sản phẩm đang ở beta công khai và dự kiến đưa lên GA trong những tuần tới. Tài liệu mình đọc chưa nêu giá, nên anh em chưa biết tốc độ cao hơn có bù được chi phí hay không.
Việc hiện chỉ có một model khiến phạm vi thử nghiệm hẹp. Anh em nên kiểm tra dữ liệu thật của mình, nhất là câu hỏi mơ hồ, nhãn gần nghĩa và ảnh có chất lượng không đều.
Mình chưa xem đây là API thay thế cho mọi tác vụ phân loại. Nó đáng thử khi app cần câu trả lời rõ dạng và phản hồi nhanh, còn bài toán cần giải thích dài hoặc schema phức tạp thì anh em nên dùng cách phù hợp hơn.
Điểm quyết định là xác suất của nó có đủ đáng tin để anh em giao một bước trong workflow hay chưa.



