Google ngày 30/9 giới thiệu Gemini 4 Argon, mô hình AI cao cấp đầu tiên thuộc thế hệ Gemini 4. Sản phẩm được định hướng xử lý những nhiệm vụ đòi hỏi khả năng suy luận nhiều bước, duy trì quy trình trong thời gian dài và thực hiện các tác vụ phức tạp trong môi trường thực tế.
Động thái này đánh dấu bước tiến mới của Google trong cuộc cạnh tranh với OpenAI, Anthropic và các hãng công nghệ đang phát triển những mô hình AI có khả năng lập trình, lập luận và vận hành theo mô hình tác nhân.
![]() |
| Google ra mắt Gemini 4 Argon, tăng tốc cuộc đua AI cao cấp |
Theo Google DeepMind, Gemini 4 Argon không chỉ tập trung vào hỏi đáp hay tạo nội dung mà còn được thiết kế cho các quy trình như phát triển phần mềm, nghiên cứu tài chính, xử lý công việc pháp lý và phòng thủ an ninh mạng.
Google hiện chưa mở rộng quyền truy cập Argon tới toàn bộ người dùng. Trong giai đoạn đầu, mô hình được cung cấp cho một nhóm chuyên gia an ninh mạng được lựa chọn thông qua chương trình Fairwind. Google cũng tham gia cơ chế đánh giá tự nguyện của Chính phủ Mỹ đối với các mô hình AI tiên tiến trước khi mở rộng phạm vi sử dụng.
Theo kế hoạch, quyền tiếp cận Argon sẽ từng bước được mở rộng tới khách hàng API trả phí và người dùng Google AI Ultra, nhưng thời điểm cụ thể chưa được công bố.
Một điểm đáng chú ý của Gemini 4 Argon là giới hạn đầu ra được nâng từ 64.000 lên 1 triệu token. Google cho rằng khả năng này giúp mô hình xử lý lượng lớn tài liệu, mã nguồn phức tạp hoặc những nhiệm vụ gồm nhiều bước mà không phải liên tục chia nhỏ yêu cầu.
Google cho biết hàng nghìn nhân viên đã sử dụng Argon trong các quy trình nội bộ. Trong một thử nghiệm, các tác nhân AI dựa trên Argon phân tích dữ liệu vận hành tại trung tâm dữ liệu và xác định giải pháp giúp giải phóng hơn 300 TiB bộ nhớ.
Các kết quả do Google DeepMind công bố cho thấy Gemini 4 Argon đạt 77,9% trên DeepSWE v1.1, cao hơn mức 74,1% của GPT-6 Astra và 74,2% của Claude Opus 5.5. Trên AutomationBench, Argon đạt 51,3%, so với 41,4% của Astra và 42,5% của Opus 5.5.
Mô hình cũng đạt 91,7% trên LVBench về khả năng hiểu video dài và 68% trên CWE-bench v1 về xử lý lỗ hổng phần mềm.
Tuy nhiên, Argon không dẫn đầu ở tất cả bài kiểm tra. Trên FrontierSWE v2, mô hình đạt 55%, thấp hơn 65,5% của Astra và 62,3% của Opus 5.5. Tại Terminal-bench 4.0, Argon đạt 57,4%, trong khi Opus 5.5 đạt 66,4%.
Các kết quả trên chủ yếu do chính các hãng phát triển công bố và được thực hiện trong những điều kiện kiểm thử cụ thể. Vì vậy, hiệu quả thực tế của Argon vẫn cần được đánh giá thêm khi mô hình được triển khai ở quy mô lớn.
Bên cạnh hiệu năng, an ninh mạng là một trọng tâm của Gemini 4 Argon. Google cho biết mô hình có thể hỗ trợ tìm kiếm, kiểm tra và vá lỗ hổng phần mềm. Tuy nhiên, những năng lực này cũng đặt ra yêu cầu cao hơn về kiểm soát an toàn do có thể bị lạm dụng cho mục đích tấn công.
Google cho biết đã bổ sung các lớp bảo vệ nhằm ngăn yêu cầu nguy hiểm, tăng khả năng chống prompt injection, giám sát hành động của tác nhân AI và cô lập môi trường thử nghiệm.
Việc phát hành từng bước cho thấy cuộc đua AI đang chuyển từ khả năng trả lời câu hỏi sang những hệ thống có thể tự thực hiện chuỗi công việc dài, đồng thời tác động trực tiếp đến phần mềm, dữ liệu và hạ tầng số.