Tin AITin tức

Anthropic ra mắt Claude Haiku 5.5 với chi phí rẻ hơn 75%

Mình vừa đọc thông báo của Anthropic về việc phát hành Claude Haiku 5.5, đây là mấy điều anh em nên biết. Hãng nói đây là model nhỏ nhanh nhất, rẻ nhất và mạnh nhất họ từng ra. Nhờ vậy, chạy agent đỡ tốn tiền hơn nhiều.

Điểm mới của Claude Haiku 5.5 về giá và hiệu năng

Theo bảng giá chính thức từ Anthropic, Haiku 5.5 giúp tiết kiệm trung bình khoảng 75% chi phí vận hành so với bản Haiku 4.5 tiền nhiệm. Cụ thể là rẻ hơn 90% với prompt dưới 100.000 token và rẻ hơn 50% với prompt trên mốc đó; Anthropic nói con số này đã tính cả việc Haiku 5.5 dùng tokenizer mới nên tốn thêm chút token cho cùng một việc, nhưng anh em vẫn nên tự đo hoá đơn thật.

Đồng hồ bấm giờ cơ học bên cạnh chồng đồng xu biểu tượng cho tốc độ và chi phí tối ưu

Token là đơn vị tính tiền. Với prompt dưới 100.000 token, mỗi triệu token đầu vào tốn 0,10 đô, mỗi triệu token đầu ra tốn 0,50 đô. Haiku 4.5 tính 1 đô đầu vào và 5 đô đầu ra cho mỗi triệu token, nên mức mới rẻ hơn hẳn.

Cùng đợt này, Anthropic giảm một nửa giá đọc cache của Sonnet 5.5, từ 0,20 đô xuống 0,10 đô mỗi triệu token (cache là phần nội dung lặp lại mà model lưu sẵn, lần sau đọc lại rẻ hơn), nên hầu hết việc agent trên Sonnet 5.5 rẻ đi khoảng 20%. Trên bài kiểm tra OSWorld 2.1 về khả năng dùng máy tính để hoàn thành công việc phức tạp, model mới đạt kết quả 72,4% ở tập ngoại tuyến.

Kết quả 72,4% này bỏ xa mốc 15,7% của bản cũ và 48,9% của GPT-6 Luna. Ở bài đánh giá công việc tri thức chuyên nghiệp GDPval-AA v2.1, sản phẩm mới ghi nhận 1620 điểm, tăng hơn gấp đôi so với 735 điểm của bản cũ. Mình thấy các chỉ số này cho thấy model nhỏ đã tiến rất xa so với Haiku 4.5, nhưng đây là điểm do chính Anthropic công bố nên anh em nên tự thử trên việc của mình.

Đối tượng phù hợp và cách đưa vào quy trình làm việc

Với giá rẻ và latency thấp, model này rất thích hợp để anh em dùng làm subagent, tức là một trợ lý AI phụ chuyên giải quyết các việc đơn lẻ. Trong các hệ thống lập trình phức tạp, anh em có thể để Opus 5.5 điều phối chung và giao việc tìm kiếm dữ liệu chi tiết cho model nhỏ xử lý. Kỹ sư Aaron Vinh tại Asana cho biết khi chạy bộ eval cho sản phẩm AI Teammates, so với model họ đang dùng, độ trễ giảm hơn 30%.

Bên HubSpot, anh Ze’ev Klapow kể là model đạt điểm cao nhất họ từng thấy trên bộ test CRM của họ, 92,8% tính trung bình ba lần chạy. Trong tuần này, Anthropic bắt đầu cấp credit API hàng tháng cho người dùng gói Max: Max 5x được 100 đô, Max 20x được 200 đô (gói Team tối đa 500 đô, dùng chung), dùng được cho mọi model trên Claude Platform.

Anh em có thể gọi model qua cloud Amazon Web Services, Google Cloud hoặc Microsoft Azure. Trên Claude Platform, anh em có thể đưa model vào sử dụng ngay từ hôm nay.

Cộng đồng Hacker News bàn luận về mốc 100.000 token

Mình lướt thảo luận trên Hacker News thì thấy anh em dev bàn nhiều nhất là mức giá chia hai tầng. Người dùng minimaxir bình luận rằng mốc 100.000 token là ranh giới quá thấp và sẽ nhanh chóng bị vượt qua nếu anh em xây dựng các hệ thống agent. Tài khoản maz1b khen ngợi tốc độ cải tiến và ủng hộ mức giá mới.

Chiếc hộp bỏ phiếu bằng kính trong suốt tượng trưng cho các ý kiến đánh giá từ cộng đồng

Về chất lượng tạo giao diện, người dùng jjcm chia sẻ thử nghiệm chuyển ảnh sang HTML cho thấy model nhỏ vẫn chưa đủ tốt để xử lý các giao diện phức tạp. Trong khi đó, satvikpendem nói mình không cần model nhỏ phải thông minh đến vậy, chủ yếu cần tốc độ, và thấy cái giá phải trả nằm ở chi phí mỗi token. Mình thấy cộng đồng đều hiểu model này sinh ra cho các việc nhẹ và nhanh.

Những giới hạn anh em cần biết trước khi áp dụng

Chỗ đầu tiên mình muốn anh em nhớ: prompt vượt 100.000 token là giá nhân lên năm lần. 100.000 token là tổng của chỉ dẫn, tài liệu và lịch sử chat gộp lại, nên agent chạy lâu rất dễ vượt. Nếu dự án hay nhồi tài liệu quá dài vào context, chi phí input sẽ vọt lên 0,50 đô và output là 2,50 đô cho mỗi triệu token.

Về khả năng lập trình agent, điểm benchmark Terminal-Bench 4.0 của nó chỉ đạt 39,2%, còn khoảng cách khá xa so với mốc 70,6% của đàn anh Sonnet 5.5. Với bài toán lập trình phức tạp trong terminal, anh em nên dùng model lớn hơn.

Theo mình, model nhỏ này hợp nhất với việc ngắn, lặp lại nhiều như tóm tắt, nén context, truy vấn database hay phân loại yêu cầu, nhất là khi prompt dưới 100.000 token. Việc code agent phức tạp thì để Sonnet 5.5 hoặc Opus 5.5. Giao đúng việc cho đúng model thì vừa đỡ tốn tiền, vừa chạy nhanh.

Nguồn tham khảo

  1. claude-haiku-5-5 · anthropic.com · Công bố chính thức · đọc ngày
  2. Anthropic ra Claude Haiku 5.5: model nhỏ, rẻ hơn (thảo luận trên Hacker News) · Hacker News · Tin tức · đọc ngày

Bài này thế nào?

Chia sẻ

XFacebook

Ảnh đại diện của chủ trang quanbi.dev

Về mình

Quân Bi · Người viết

Xem thêm →

Bình luận (0)

Chưa có bình luận nào. Bạn mở hàng nhé.

Viết bình luận