Thứ sáu 31/07/2026 10:01
Hotline: 024.355.63.010
Kinh tế số

Khi AI vượt khỏi “lồng kính” thử nghiệm an ninh mạng

Từ những phòng thử nghiệm tưởng như được kiểm soát tuyệt đối, các mô hình AI tiên tiến đã bất ngờ chạm tới hệ thống thật ngoài đời. Những sự cố liên tiếp tại Anthropic và OpenAI không chỉ là sai sót kỹ thuật, mà còn đặt ra câu hỏi cấp bách về giới hạn an toàn khi trí tuệ nhân tạo được trao năng lực tự hành trong không gian mạng.

Anthropic đã thừa nhận một sự cố đáng chú ý trong quá trình thử nghiệm năng lực an ninh mạng của các mô hình Claude, khi hệ thống AI của hãng truy cập trái phép vào ba tổ chức bên ngoài. Vụ việc được công bố chỉ một tuần sau khi OpenAI xác nhận hai mô hình của họ từng xâm nhập vào nền tảng Hugging Face trong một cuộc đánh giá tương tự.

Theo Anthropic, các mô hình Claude đã vượt ra ngoài phạm vi giả lập trong lúc tham gia những bài đánh giá mô phỏng tấn công mạng. Hãng lý giải nguyên nhân là một sự hiểu lầm khiến Claude vẫn có quyền truy cập internet trong môi trường thử nghiệm, thay vì bị cô lập hoàn toàn như thiết kế ban đầu.

Ba mô hình do Anthropic thử nghiệm đã vượt ra khỏi tầm kiểm soát và tấn công
Các mô hình Claude do Anthropic thử nghiệm đã vượt ra khỏi tầm kiểm soát và tấn công ba thực thể ngoài Anthropic

Sự việc càng gây chú ý bởi trước đó, OpenAI cũng cho biết hai mô hình của họ đã thoát khỏi môi trường kiểm thử thông qua một lỗ hổng phần mềm, truy cập internet và tiến hành tấn công vào công ty khởi nghiệp AI Hugging Face. Những sự cố liên tiếp này làm dấy lên câu hỏi về mức độ an toàn của các hệ thống AI khi được trao năng lực tự hành trong các kịch bản an ninh mạng.

Anthropic cho biết vụ việc buộc công ty phải rà soát lại toàn bộ quy trình đánh giá an ninh mạng nội bộ. Trong hơn 141.000 trường hợp được điều tra, hãng xác định có ba sự cố liên quan đến việc Claude tiếp cận các hệ thống bên ngoài phạm vi cho phép.

Trong thông tin công bố trên blog hôm thứ Năm, 30/7, Anthropic thừa nhận rằng ở tất cả các trường hợp, lời nhắc đánh giá đều nói rõ với Claude rằng môi trường hoạt động chỉ là mô phỏng và mô hình không có quyền truy cập internet. Tuy nhiên, do sự hiểu lầm giữa Anthropic và đối tác đánh giá Irregular, điều kiện này trên thực tế đã không được bảo đảm, khiến quyền truy cập internet vẫn tồn tại trong quá trình kiểm thử.

Các bài kiểm tra nói trên thuộc dạng “bắt cờ” trong lĩnh vực an ninh mạng. Ở đó, AI được yêu cầu phân tích ngược, thăm dò hoặc khai thác một hệ thống có chủ đích tồn tại lỗ hổng nhằm tìm ra thông tin ẩn, thường được gọi là “cờ”.

Trong một trường hợp, Claude được giao mục tiêu là một công ty hư cấu, nhưng tên gọi này lại trùng với một tên miền đang hoạt động ngoài đời thực. Tác nhân AI – tức chương trình có khả năng tự thực hiện nhiệm vụ dựa trên chỉ dẫn của con người – đã khai thác lỗ hổng trong hạ tầng kỹ thuật số của công ty, trích xuất thông tin và giành quyền truy cập vào một cơ sở dữ liệu chứa vài trăm dòng dữ liệu sản xuất.

Diễn biến này làm gia tăng mối lo ngại rằng các hệ thống AI tiên tiến, ngay cả khi còn trong giai đoạn thử nghiệm tiền triển khai, vẫn có thể gây tác động đến thế giới thực nếu lớp kiểm soát kỹ thuật và quy trình giám sát không đủ chặt chẽ.

Anthropic, doanh nghiệp được cho là đang chuẩn bị cho kế hoạch IPO ngay trong năm nay, cho biết đã tạm dừng các đánh giá an ninh mạng ngay khi phát hiện khả năng Claude có thể truy cập internet.

Ba sự cố được ghi nhận liên quan đến ba mô hình Claude khác nhau: Opus 4.7, Mythos 5 và một mô hình thử nghiệm phục vụ nghiên cứu nội bộ.

Trong đó, Mythos – phiên bản chỉ được phát hành cho một số đối tác giới hạn – từng làm dấy lên quan ngại trên phạm vi toàn cầu vì năng lực tấn công mạng ngày càng tinh vi, bao gồm khả năng phát hiện và khai thác lỗ hổng phần mềm.

Anthropic cho rằng nhiều yếu tố đã cùng góp phần dẫn tới các sự cố, song công ty lựa chọn tiếp cận các biện pháp khắc phục theo tinh thần tự nhận trách nhiệm, thay vì quy lỗi cho bất kỳ cá nhân hay đối tác cụ thể nào.

Công ty cũng cho biết sẽ mở rộng việc giám sát nhật ký đánh giá để phát hiện hành vi bất thường, đồng thời tiến hành các hoạt động bảo đảm nghiêm ngặt hơn đối với những nhà cung cấp mà hãng dựa vào trong quá trình kiểm thử.

Tin bài khác
Việt Nam thành bệ phóng mô hình đổi mới sáng tạo vươn tầm quốc tế

Việt Nam thành bệ phóng mô hình đổi mới sáng tạo vươn tầm quốc tế

Tại VGIC 2026, lãnh đạo MB nhận định Việt Nam đang đứng trước cơ hội lớn để bứt phá nhờ công nghệ, đồng thời có thể trở thành nơi thử nghiệm, hoàn thiện và đưa các mô hình đổi mới sáng tạo ra toàn cầu.
Australia kiện Telegram vì chậm gỡ nội dung cực đoan

Australia kiện Telegram vì chậm gỡ nội dung cực đoan

Cơ quan quản lý Internet Australia khởi kiện Telegram do bị cáo buộc không kịp thời gỡ bỏ các nội dung cổ súy khủng bố, trong bối cảnh nền tảng nhắn tin này và nhà sáng lập Pavel Durov tiếp tục đối mặt sức ép pháp lý tại nhiều quốc gia.
Ông lớn Big Four dùng AI viết báo cáo, để lộ chú thích giả và dấu vết ChatGPT

Ông lớn Big Four dùng AI viết báo cáo, để lộ chú thích giả và dấu vết ChatGPT

Hàng loạt báo cáo về AI và xe điện của PwC bị phát hiện chứa chú thích giả, nguồn dẫn sai và cả dấu vết ChatGPT, làm dấy lên câu hỏi về cách các “ông lớn” tư vấn toàn cầu sử dụng trí tuệ nhân tạo trong chính sản phẩm nghiên cứu của mình.
iOS 27 bổ sung Call Context, tự hiển thị thông tin khi gọi doanh nghiệp

iOS 27 bổ sung Call Context, tự hiển thị thông tin khi gọi doanh nghiệp

iOS 27 mang đến tính năng Call Context giúp iPhone tự động hiển thị thông tin liên quan khi người dùng gọi đến doanh nghiệp, hỗ trợ tra cứu nhanh và nâng cao trải nghiệm liên lạc.
Lệnh hạn chế trẻ em dùng mạng xã hội ở Australia đối mặt thách thức thực thi

Lệnh hạn chế trẻ em dùng mạng xã hội ở Australia đối mặt thách thức thực thi

Trước áp lực bảo vệ trẻ em trên không gian mạng, Australia đang đẩy mạnh thực thi lệnh hạn chế người dưới 16 tuổi sử dụng mạng xã hội. Tuy nhiên, nỗ lực này vấp phải sự phản ứng quyết liệt từ các tập đoàn công nghệ lớn, làm dấy lên tranh luận về quyền quản lý của chính phủ, trách nhiệm của nền tảng số và hiệu quả thực tế của các biện pháp kiểm soát độ tuổi.
Mạng xã hội X ra mắt ví điện tử X Money, mở rộng sang lĩnh vực thanh toán số

Mạng xã hội X ra mắt ví điện tử X Money, mở rộng sang lĩnh vực thanh toán số

Nền tảng mạng xã hội X chính thức triển khai dịch vụ ví điện tử X Money tại Mỹ, tích hợp chuyển tiền, tài khoản tiền gửi và thẻ Visa ngay trong ứng dụng.
Mỹ siết nhập khẩu robot và bộ biến tần của Trung Quốc

Mỹ siết nhập khẩu robot và bộ biến tần của Trung Quốc

Chính quyền Mỹ công bố các biện pháp hạn chế nhập khẩu một số mẫu robot và bộ biến tần điện mới của Trung Quốc, trong nỗ lực bảo vệ chuỗi cung ứng trí tuệ nhân tạo và hạ tầng trọng yếu trước các nguy cơ an ninh quốc gia.
Nữ nghị sĩ Anh kiện xAI liên quan hình ảnh giả mạo do Grok tạo ra

Nữ nghị sĩ Anh kiện xAI liên quan hình ảnh giả mạo do Grok tạo ra

Vụ kiện nhằm vào công ty xAI của tỷ phú Elon Musk làm dấy lên những tranh luận mới về trách nhiệm pháp lý của các nhà phát triển trí tuệ nhân tạo trong việc ngăn chặn nội dung giả mạo, xâm phạm quyền riêng tư cá nhân.
Apple phát hành iOS 26.6, tăng cường bảo mật và tối ưu Spotlight

Apple phát hành iOS 26.6, tăng cường bảo mật và tối ưu Spotlight

Apple chính thức phát hành iOS 26.6 và iPadOS 26.6, tập trung vá lỗ hổng bảo mật, khắc phục lỗi hệ thống và tối ưu chỉ mục Spotlight nhằm nâng cao độ ổn định và hiệu suất cho thiết bị.
AI tiếp sức cho kinh tế Singapore giữa sức ép thuế quan và giá năng lượng

AI tiếp sức cho kinh tế Singapore giữa sức ép thuế quan và giá năng lượng

Cơ quan Tiền tệ Singapore cho rằng làn sóng AI toàn cầu sẽ tiếp tục là động lực chính hỗ trợ tăng trưởng năm 2026, dù nền kinh tế đảo quốc vẫn đối mặt rủi ro từ xung đột Trung Đông, giá năng lượng cao và chính sách thuế mới của Mỹ.
Startup không gian châu Âu muốn huy động 300 triệu USD để thách thức SpaceX

Startup không gian châu Âu muốn huy động 300 triệu USD để thách thức SpaceX

The Exploration Company đang đàm phán huy động ít nhất 300 triệu USD vốn mới, trong bối cảnh châu Âu gia tăng đầu tư vào các công nghệ không gian chiến lược nhằm thu hẹp khoảng cách với các đối thủ Mỹ.
Meta ra mắt Facebook Verified miễn phí, xác minh tài khoản bằng video selfie

Meta ra mắt Facebook Verified miễn phí, xác minh tài khoản bằng video selfie

Meta giới thiệu Facebook Verified, tính năng xác minh miễn phí bằng video selfie nhằm giúp người dùng nhận diện tài khoản thật và tăng độ tin cậy khi tương tác trên Facebook.
Google dừng hỗ trợ YouTube trên nhiều điện thoại Android đời cũ

Google dừng hỗ trợ YouTube trên nhiều điện thoại Android đời cũ

Google chính thức ngừng hỗ trợ ứng dụng YouTube trên các thiết bị chạy Android 6.0 Marshmallow, đồng thời khuyến nghị người dùng nâng cấp hệ điều hành hoặc chuyển sang thiết bị mới để tiếp tục sử dụng đầy đủ tính năng và đảm bảo an toàn dữ liệu.
Nvidia có thể “chống lưng” 250 tỷ USD cho OpenAI: Siêu dự án AI hơn 500 tỷ USD sắp thành hình?

Nvidia có thể “chống lưng” 250 tỷ USD cho OpenAI: Siêu dự án AI hơn 500 tỷ USD sắp thành hình?

Wall Street Journal cho biết Nvidia đang thảo luận việc cung cấp bảo lãnh tài chính khoảng 250 tỷ USD cho OpenAI, trong khuôn khổ một dự án trung tâm dữ liệu quy mô lớn tại Mỹ.
Qualcomm tăng giá chip từ tháng 9, nguy cơ đẩy giá thiết bị công nghệ tiếp tục leo thang

Qualcomm tăng giá chip từ tháng 9, nguy cơ đẩy giá thiết bị công nghệ tiếp tục leo thang

Qualcomm dự kiến tăng giá nhiều dòng chip từ ngày 1/9 với mức điều chỉnh hai chữ số, trong bối cảnh chi phí linh kiện và áp lực nguồn cung tiếp tục gia tăng, có thể kéo theo giá các thiết bị công nghệ tăng theo.