Mình đọc tài liệu Google và thảo luận người dùng để đánh giá Gemini 4 Argon, rồi chốt luôn với anh em: model này đáng theo dõi cho coding, nghiên cứu và security, nhưng chưa đáng để đổi công cụ ngay. Mình chưa tự chạy thử, nên bài này chỉ dựa trên tài liệu hãng và ý kiến trong thảo luận Hacker News.
Gemini 4 Argon là gì và khác bản trước ở đâu
Google mô tả Argon là model dành cho các workflow dài, nhiều bước, gồm coding, nghiên cứu tài chính, soạn thảo pháp lý và phòng thủ security. Tài liệu nói model đang được mở cho một nhóm người làm security đáng tin cậy trước khi Google mở dần cho developer, doanh nghiệp và người dùng.
Thay đổi lớn nhất nằm ở output token limit. Anh em có thể hiểu đơn giản rằng model có thêm chỗ để suy luận, đọc context dài và tạo ra một chuỗi thao tác lớn trong một lần xử lý.
Điểm này hợp với những việc như đọc nhiều file, lần theo lỗi, lập kế hoạch sửa code rồi kiểm tra lại. Người chỉ hỏi đáp ngắn có thể chưa thấy khác biệt rõ, còn anh em làm migration hoặc nghiên cứu nhiều tài liệu sẽ quan tâm hơn.
Mình chưa có bản public để kiểm tra xem context lớn ảnh hưởng thế nào tới tốc độ, độ ổn định và chi phí thật. Vì vậy, phần khác biệt hiện mới dừng ở tài liệu công bố.
Điểm mạnh mà Google công bố
Tài liệu ghi Argon đạt 77,9% trên DeepSWE v1.1, bài đánh giá các tác vụ coding dài và gần với công việc thật. Google cũng ghi model đứng đầu AutomationBench của Zapier với 51,3%, trong đó bài test đo khả năng thực hiện trọn workflow cho các việc doanh nghiệp.
Các số này đáng để theo dõi. Mình vẫn muốn anh em giữ khoảng cách với cách hãng trình bày, vì một người bình luận Hacker News cho rằng benchmark đang bị đẩy quá sát giới hạn và họ muốn chờ dùng thật trước khi tin vào vị trí dẫn đầu.
Ở phần hiểu hình ảnh và video, tài liệu ghi Argon đạt 91,7% trên LVBench, bài đo khả năng hiểu video dài. Google cũng mô tả model có thể phân tích chart, tìm chi tiết trong video dài rồi hành động dựa trên nhiều tài liệu.
Google đưa thêm vài ví dụ nội bộ.
Tuy vậy, anh em chưa nên coi kết quả nội bộ là năng suất chắc chắn trong repo hoặc quy trình của mình.
Điểm yếu và lời phàn nàn từ người dùng
Điểm yếu lớn nhất hiện tại là quyền truy cập. Tài liệu nói Google sẽ tiếp tục thu thập feedback từ tester sớm, củng cố guardrails rồi mới mở cho developer, doanh nghiệp và người dùng.
Thảo luận Hacker News phản ứng khá gay gắt với việc công bố model trước khi phát hành rộng. Một người bình luận viết rằng Argon vẫn chưa tới tay người dùng phổ thông, còn người khác phàn nàn họ chỉ thấy model cũ trong sản phẩm mình đang trả phí.
Một nhóm người dùng nghi ngờ Google đang tập trung quá nhiều vào benchmark thay vì trải nghiệm dùng thật. Họ muốn có model trong app, terminal hoặc API để làm việc ngay, thay vì đọc các tuyên bố về một bản vẫn đang mở dần.
Đây là ý kiến của người bình luận, không phải kết luận độc lập của mình. Dù vậy, phàn nàn này chạm đúng điều anh em làm nghề quan tâm: model mạnh trên giấy vẫn chưa giúp được gì nếu chưa vào workflow hàng ngày.
Phần safety cũng có thể kéo dài thời gian phát hành. Google nói họ đang kiểm tra khả năng chống prompt injection, theo dõi misalignment và cô lập sandbox trước các bài test rủi ro cao.
Cách làm đó hợp lý về kiểm soát. Nó cũng có nghĩa anh em phải chờ lâu hơn, nhất là khi hãng chưa nêu mốc mở rộng quyền truy cập cụ thể.
Giá và cách truy cập
Giá mở đầu của Argon là 2 đô cho mỗi triệu input token và 10 đô cho mỗi triệu output token. Cached input token được giảm 95% so với giá input, nên workflow lặp lại cùng một phần context có thể tiết kiệm đáng kể.
Mức giá này gây chú ý nếu model thật sự xử lý tốt task dài. Anh em chưa nên lấy giá làm lý do chuyển ngay, vì quyền truy cập vẫn giới hạn ở tester, người làm security và các nhóm được Google mở dần.
Google nói Argon sẽ tới developer, doanh nghiệp và người dùng sau giai đoạn thử nghiệm, bắt đầu với paid API customer và người đăng ký Google AI Ultra. Tài liệu chưa ghi ngày phát hành rộng rãi, nên mình chưa thể khuyên anh em lập kế hoạch dựa trên một mốc chưa có.
Ai nên thử và ai nên chờ
Anh em làm backend, devtool hoặc nghiên cứu dữ liệu nên theo dõi model này nếu công việc có nhiều file, nhiều bước và cần giữ context dài. Các nhóm security cũng có lý do để quan tâm, vì Google nói Argon có thể tự tìm, xác nhận và vá vulnerability trong software.
Google ghi Wiz đang dùng Argon qua chương trình Scan for Good để tìm và sửa lỗ hổng trong hạ tầng công cộng.
Anh em làm content, sales hoặc vận hành với task ngắn nên chờ thêm. Những nhóm này khó hưởng lợi từ context lớn nếu model chưa có giao diện dễ dùng, quyền truy cập ổn định và bằng chứng từ người dùng độc lập.
Founder cũng nên chờ. Đừng đưa Argon vào workflow sản xuất chỉ vì một bảng benchmark đẹp, nhất là khi Google chưa mở quyền truy cập rộng và cộng đồng vẫn đang chờ dùng thật.
Mình xếp Argon vào nhóm đáng theo dõi, chưa phải công cụ cần mua ngay: giá hấp dẫn, khả năng xử lý task dài có vẻ mạnh, còn khoảng cách giữa thông báo và lúc anh em dùng được vẫn quá lớn.



