Mục lục
Hầu hết các bài báo về Gemini 4 Argon đều xoay quanh một câu hỏi: Google đã đuổi kịp OpenAI và Anthropic chưa?
Tôi nghĩ đó là câu hỏi sai. Benchmark sẽ còn được tranh cãi vài tuần nữa, và chưa ai bên ngoài Google tự kiểm chứng được. Điều đã chắc chắn thì nằm ở chỗ khác: mô hình mạnh nhất của Google không được trao cho lập trình viên trước, mà cho những người đi vá lỗ hổng.
Chi tiết đó thay đổi cách một mô hình AI được "ra mắt". Nó cũng ảnh hưởng trực tiếp đến bất kỳ doanh nghiệp nào đang chạy một website.
Chuyện gì đã xảy ra, theo đúng ngày
- Ngày 2/9/2026: Google khởi động Fairwind Program, chương trình truy cập giới hạn dành cho cơ quan chính phủ, cơ quan an ninh mạng quốc gia, đơn vị vận hành hạ tầng trọng yếu (y tế, viễn thông, năng lượng, tài chính) và các đối tác bảo mật. Theo Google, chương trình có hơn 650 đối tác trên toàn cầu. Mô hình đầu tiên được đưa vào chương trình là Gemini 3.8 Flash Cyber, đi cùng công cụ vá lỗi CodeMender (Google).
- Ngày 30/9/2026: Google công bố Gemini 4 Argon, bài viết do Koray Kavukcuoglu, Phó chủ tịch cấp cao của Google DeepMind, đứng tên. Ngay lúc công bố, mô hình chỉ mở cho các đơn vị phòng thủ trong Fairwind và các đội nội bộ của Google (Google, 9to5Google).
Lập trình viên, doanh nghiệp và người dùng phổ thông sẽ được dùng sau. Google chỉ nói sẽ mở "as soon as possible", bắt đầu với khách hàng API trả phí và người đăng ký Google AI Ultra. Hiện chưa có ngày cụ thể, và cũng chưa rõ "Argon" có phải tên thương mại cuối cùng hay không (XDA Developers qua daily.dev).
Những con số Google công bố, và vì sao chưa nên tin hết
Theo bảng của Google và 9to5Google:
| Bài kiểm tra | Gemini 4 Argon | Ghi chú |
|---|---|---|
| DeepSWE v1.1 (kỹ thuật phần mềm) | 77,9% | Claude Opus 5.5: 74,2% · GPT-6 Astra: 74,1% |
| CWE-bench v1 (vá lỗ hổng bảo mật) | 68% | Đồng hạng nhất |
| AutomationBench (thực thi nghiệp vụ trọn vẹn) | 51,3 | Hạng 1 |
| LVBench (hiểu video dài) | 91,7% | Mức cao nhất hiện tại |
Ngoài ra, giới hạn đầu ra tăng lên 1 triệu token, so với 64 nghìn ở các đời Gemini trước (Google).
Nhìn thì ấn tượng. Nhưng có ba điều cần đọc kèm.
Một, đây là bảng của chính Google, và hiện gần như không ai ngoài Google chạy thử được mô hình. Một benchmark không ai tái kiểm được chỉ nên xem là lời tuyên bố, chưa phải kết quả.
Hai, khoảng cách khá nhỏ. Hơn Opus 5.5 3,7 điểm phần trăm trên DeepSWE là có ý nghĩa, nhưng chưa đến mức "bỏ xa". Trong thực tế, cách bạn cấu hình và bọc mô hình (prompt, công cụ, quy trình kiểm tra) thường tạo ra chênh lệch lớn hơn thế. Tôi đã viết kỹ về điều này trong bài harness quan trọng hơn mô hình.
Ba, ngay trong Google cũng có người hoài nghi. Theo Bloomberg (được byteiota dẫn lại), một số nhân viên Google cho rằng Argon làm việc thực tế kém hơn kết quả benchmark, chẳng hạn ở vài tác vụ lập trình. Google phản bác nhận định này. Đây là thông tin từ nguồn ẩn danh, nên tôi chỉ ghi nhận và không kết luận, nhưng nó đủ lý do để bạn đợi thử thật trước khi đổi cả hệ thống sang Argon.
Tin thật sự: mô hình mạnh nhất giờ được phát theo thứ tự ưu tiên
Đây là phần tôi cho là quan trọng nhất, và cũng ít được bàn nhất.
Google giải thích thẳng lý do: họ huấn luyện Argon để "highly capable at cybersecurity defense". Mô hình có thể tự tìm, xác minh và vá các lỗ hổng phần mềm nghiêm trọng (Google). Một năng lực như vậy dùng được cho cả hai phía. Ai có khả năng tìm lỗ hổng để vá thì cũng có khả năng tìm lỗ hổng để khai thác.
Vì thế, Google chọn trao cho bên phòng thủ trước, đồng thời tham gia quy trình tự nguyện của chính phủ Mỹ để cơ quan chức năng được tiếp cận mô hình trước khi phát hành. Theo bài công bố, họ cũng đang giám sát hoạt động bên trong của mô hình để phát hiện lạm dụng và hành vi lệch mục tiêu (Google). Mô hình được thiết kế để từ chối các yêu cầu nguy hiểm liên quan đến tấn công mạng và vũ khí CBRN theo Frontier Safety Framework của Google (XDA Developers qua daily.dev).
Google không phải hãng duy nhất đi theo hướng này. Tuần trước, Anthropic cũng cho Sonnet 5.5 tự chuyển về mô hình cũ khi gặp tác vụ an ninh mạng rủi ro cao (tôi đã phân tích trong bài về Sonnet 5.5). Trước đó, OpenAI dừng huấn luyện sau vụ agent thoát sandbox. Ba hãng lớn, ba cách khác nhau, cùng một thông điệp:
Kiểu "ngày ra mắt" quen thuộc, khi tất cả mọi người dùng được một mô hình cùng lúc, đang dần biến mất ở nhóm mô hình mạnh nhất. Khoảng cách giữa lúc một năng lực tồn tại và lúc bạn được dùng nó sẽ ngày càng dài, và ai được dùng trước sẽ do nhà cung cấp quyết định.
Doanh nghiệp nhỏ thì liên quan gì?
Bạn sẽ không có Argon trong vài tuần tới, và có lẽ cũng chưa cần. Nhưng câu chuyện này chạm đến bạn ở chỗ ít ai nghĩ tới: website của bạn.
Hãy hình dung tốc độ. Gemini 3.8 Flash Cyber, mô hình đời trước trong Fairwind, đã được Google mô tả là giúp đội phòng thủ tạo bản vá "trong vài phút thay vì vài tuần" (Google). Argon được quảng bá là mạnh hơn. Khi máy móc tìm lỗi nhanh như vậy, số lượng lỗ hổng được công bố sẽ tăng lên, và kéo theo đó là số bản vá bạn cần cài.
Chúng ta đã thấy điều này ngay trong tháng này: WordPress vá một lỗ hổng nằm im gần 10 năm, rồi cPanel và tường lửa Fortinet cũng lần lượt phải vá. Không có gì ngạc nhiên nếu nhịp độ này còn nhanh hơn.
Vấn đề là bên phòng thủ được tăng tốc thì bên tấn công cũng sớm theo kịp. Những năng lực tương tự rồi sẽ có trong các mô hình phổ thông, hoặc trong mô hình mã nguồn mở không có cơ chế từ chối nào. Lợi thế đi trước của Fairwind chỉ là tạm thời. Điều kéo dài là thời gian từ lúc bản vá ra đến lúc bị khai thác sẽ ngày càng ngắn.
Với một doanh nghiệp vừa và nhỏ, hệ quả rất cụ thể:
- Website "làm xong là để đó" sẽ ngày càng rủi ro. Một plugin không cập nhật sáu tháng trước đây có thể chỉ là chuyện nhỏ. Sắp tới thì không còn như vậy.
- Cần có người chịu trách nhiệm cập nhật. Câu hỏi nên đặt cho đơn vị làm web của bạn không phải "bạn dùng AI gì", mà là: khi một lỗ hổng được công bố vào sáng thứ Hai, bao lâu thì website của tôi được vá?
- Càng ít thành phần bên thứ ba thì càng ít chỗ để lọt. Mỗi plugin, mỗi thư viện là thêm một chỗ phải theo dõi.
Giá khởi điểm hấp dẫn, nhưng hãy tính theo giá thật
Một chi tiết nhỏ nhưng nhiều người sẽ đọc lướt qua. Argon ra mắt với giá khởi điểm 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra, input được cache giảm 95%. Sau giai đoạn khởi điểm, giá tăng gấp đôi lên 4 USD và 20 USD (Google, 9to5Google).
Để so sánh, theo Yahoo Finance, Claude Opus 5.5 đang ở mức 4 USD và 20 USD, còn GPT-6 Astra ở mức 10 USD và 50 USD.
Nói cách khác: giá chính thức của Argon bằng đúng giá Opus 5.5. Mức giảm 50% lúc đầu là để thu hút người dùng, không phải mức giá lâu dài. Nếu bạn lập ngân sách cho một sản phẩm AI, hãy tính theo giá sau ưu đãi, và như tôi đã viết trong bài về Sonnet 5.5, hãy so chi phí cho mỗi công việc hoàn thành chứ đừng chỉ so giá mỗi token.
Còn giới hạn đầu ra 1 triệu token là con dao hai lưỡi. Nó cho phép giao cả một đợt chuyển đổi mã nguồn lớn trong một lần. Theo 9to5Google, Google đang dùng Argon nội bộ cho các dự án chuyển C/C++ sang Rust lên tới hơn 800 nghìn dòng. Nhưng nó cũng có nghĩa là một tác vụ chạy sai có thể đốt hóa đơn nhiều hơn hẳn trước đây. Đặt giới hạn chi tiêu trước khi bật thử.
Ba điều nên làm sau tin này
- Đừng thay đổi kế hoạch vì một mô hình bạn chưa được dùng. Khi Argon mở API, hãy thử trên chính công việc của bạn rồi mới so sánh. Benchmark của nhà cung cấp chỉ là điểm khởi đầu.
- Rà lại quy trình cập nhật website ngay bây giờ. Biết website đang chạy những thành phần gì, ai cập nhật, và cập nhật nhanh đến đâu khi có lỗ hổng mới. Nếu chưa có câu trả lời rõ ràng, đó là việc nên ưu tiên trong quý này.
- Lập ngân sách AI theo giá sau ưu đãi, và luôn có giới hạn chi tiêu cho các tác vụ chạy dài.
Câu hỏi "Google có thắng không" sẽ có lời giải trong vài tháng tới. Còn câu hỏi "website của tôi có theo kịp tốc độ vá lỗi mới không" thì nên trả lời từ bây giờ.
Nếu bạn muốn một đơn vị kiểm tra lại website và đảm nhận phần bảo trì, cập nhật bảo mật định kỳ, hãy xem các dịch vụ của chúng tôi hoặc liên hệ trực tiếp.
Nguồn
- Google — Gemini 4 Argon: our next era of frontier intelligence (30/9/2026)
- Google — Proactive cyber defense for governments and enterprises (Fairwind Program) (2/9/2026)
- 9to5Google — Google announces Gemini 4 Argon as its new frontier model (30/9/2026)
- Yahoo Finance — Google debuts Gemini 4 Argon, its latest frontier model
- daily.dev / XDA Developers — Google reveals Gemini 4 Argon, but you're not allowed to use it
- byteiota — Gemini 4 Argon Launches: Benchmark Lead or Benchmaxxing? (dẫn lại báo cáo của Bloomberg)

