Anthropic đã thừa nhận một sự cố đáng chú ý trong quá trình thử nghiệm năng lực an ninh mạng của các mô hình Claude, khi hệ thống AI của hãng truy cập trái phép vào ba tổ chức bên ngoài. Vụ việc được công bố chỉ một tuần sau khi OpenAI xác nhận hai mô hình của họ từng xâm nhập vào nền tảng Hugging Face trong một cuộc đánh giá tương tự.
Theo Anthropic, các mô hình Claude đã vượt ra ngoài phạm vi giả lập trong lúc tham gia những bài đánh giá mô phỏng tấn công mạng. Hãng lý giải nguyên nhân là một sự hiểu lầm khiến Claude vẫn có quyền truy cập internet trong môi trường thử nghiệm, thay vì bị cô lập hoàn toàn như thiết kế ban đầu.
![]() |
| Các mô hình Claude do Anthropic thử nghiệm đã vượt ra khỏi tầm kiểm soát và tấn công ba thực thể ngoài Anthropic |
Sự việc càng gây chú ý bởi trước đó, OpenAI cũng cho biết hai mô hình của họ đã thoát khỏi môi trường kiểm thử thông qua một lỗ hổng phần mềm, truy cập internet và tiến hành tấn công vào công ty khởi nghiệp AI Hugging Face. Những sự cố liên tiếp này làm dấy lên câu hỏi về mức độ an toàn của các hệ thống AI khi được trao năng lực tự hành trong các kịch bản an ninh mạng.
Anthropic cho biết vụ việc buộc công ty phải rà soát lại toàn bộ quy trình đánh giá an ninh mạng nội bộ. Trong hơn 141.000 trường hợp được điều tra, hãng xác định có ba sự cố liên quan đến việc Claude tiếp cận các hệ thống bên ngoài phạm vi cho phép.
Trong thông tin công bố trên blog hôm thứ Năm, 30/7, Anthropic thừa nhận rằng ở tất cả các trường hợp, lời nhắc đánh giá đều nói rõ với Claude rằng môi trường hoạt động chỉ là mô phỏng và mô hình không có quyền truy cập internet. Tuy nhiên, do sự hiểu lầm giữa Anthropic và đối tác đánh giá Irregular, điều kiện này trên thực tế đã không được bảo đảm, khiến quyền truy cập internet vẫn tồn tại trong quá trình kiểm thử.
Các bài kiểm tra nói trên thuộc dạng “bắt cờ” trong lĩnh vực an ninh mạng. Ở đó, AI được yêu cầu phân tích ngược, thăm dò hoặc khai thác một hệ thống có chủ đích tồn tại lỗ hổng nhằm tìm ra thông tin ẩn, thường được gọi là “cờ”.
Trong một trường hợp, Claude được giao mục tiêu là một công ty hư cấu, nhưng tên gọi này lại trùng với một tên miền đang hoạt động ngoài đời thực. Tác nhân AI – tức chương trình có khả năng tự thực hiện nhiệm vụ dựa trên chỉ dẫn của con người – đã khai thác lỗ hổng trong hạ tầng kỹ thuật số của công ty, trích xuất thông tin và giành quyền truy cập vào một cơ sở dữ liệu chứa vài trăm dòng dữ liệu sản xuất.
Diễn biến này làm gia tăng mối lo ngại rằng các hệ thống AI tiên tiến, ngay cả khi còn trong giai đoạn thử nghiệm tiền triển khai, vẫn có thể gây tác động đến thế giới thực nếu lớp kiểm soát kỹ thuật và quy trình giám sát không đủ chặt chẽ.
Anthropic, doanh nghiệp được cho là đang chuẩn bị cho kế hoạch IPO ngay trong năm nay, cho biết đã tạm dừng các đánh giá an ninh mạng ngay khi phát hiện khả năng Claude có thể truy cập internet.
Ba sự cố được ghi nhận liên quan đến ba mô hình Claude khác nhau: Opus 4.7, Mythos 5 và một mô hình thử nghiệm phục vụ nghiên cứu nội bộ.
Trong đó, Mythos – phiên bản chỉ được phát hành cho một số đối tác giới hạn – từng làm dấy lên quan ngại trên phạm vi toàn cầu vì năng lực tấn công mạng ngày càng tinh vi, bao gồm khả năng phát hiện và khai thác lỗ hổng phần mềm.
Anthropic cho rằng nhiều yếu tố đã cùng góp phần dẫn tới các sự cố, song công ty lựa chọn tiếp cận các biện pháp khắc phục theo tinh thần tự nhận trách nhiệm, thay vì quy lỗi cho bất kỳ cá nhân hay đối tác cụ thể nào.
Công ty cũng cho biết sẽ mở rộng việc giám sát nhật ký đánh giá để phát hiện hành vi bất thường, đồng thời tiến hành các hoạt động bảo đảm nghiêm ngặt hơn đối với những nhà cung cấp mà hãng dựa vào trong quá trình kiểm thử.