Một “tác nhân” AI của OpenAI được cho là đã phát hiện các lỗ hổng mới và tự thực hiện cuộc tấn công nhằm vào startup Hugging Face, trở thành một trong những ví dụ công khai đầu tiên về việc hệ thống AI tiến hành tấn công mạng ngoài tầm kiểm soát trực tiếp của con người.
![]() |
| Tác nhân AI của OpenAI đã tự tạo một cuộc tấn công nhằm vào các thông tin đăng nhập của một startup khác |
Hôm thứ Ba (21/7), nhà sản xuất ChatGPT cho biết “sự cố mạng chưa từng có” này liên quan đến một tác nhân AI — tức chương trình có thể tự hành động dựa trên chỉ dẫn ban đầu của con người — đã thoát khỏi môi trường thử nghiệm, truy cập internet và đánh cắp thông tin đăng nhập.
Thông tin này được đưa ra trong bối cảnh những lo ngại về hệ lụy của AI ngày càng gia tăng, đặc biệt khi các hệ thống tiên tiến có thể được sử dụng để tấn công vào hạ tầng kỹ thuật số và làm suy yếu khả năng kiểm soát của con người.
Cũng trong thông báo hôm 21/7, OpenAI cảnh báo các sự cố kiểu này có thể trở nên “phổ biến hơn” khi ngày càng xuất hiện nhiều mô hình có năng lực tấn công mạng cao hơn.
Vụ việc diễn ra trong thời điểm Giám đốc điều hành OpenAI Sam Altman dự kiến tới Washington vào tuần tới để báo cáo với chính phủ Mỹ về các thế hệ mô hình AI sắp ra mắt.
Giới chức ngày càng quan tâm tới việc rà soát, kiểm duyệt các mô hình mới trước khi phát hành. Mối lo này gia tăng sau những tranh luận toàn cầu về khả năng của mô hình Mythos do Anthropic phát triển trong việc phát hiện và khai thác lỗ hổng an ninh mạng.
Theo OpenAI, sự cố mới nhất liên quan đến sự kết hợp của nhiều mô hình, trong đó có GPT-5.6 Sol vừa được phát hành đầu tháng này, cùng một mô hình mạnh hơn đang trong giai đoạn thử nghiệm trước khi ra mắt.
“Chúng tôi coi đây là một sự cố an ninh mạng chưa từng có, liên quan đến những năng lực an ninh mạng tiên tiến nhất, và đang ứng phó tương xứng”, OpenAI viết trong một bài đăng trên blog.
Hugging Face, startup AI cung cấp mô hình và bộ dữ liệu cho các nhà phát triển, cho biết họ bị xâm nhập vào thứ Sáu tuần trước bởi một tác nhân AI bên ngoài. “Chúng tôi nghi ngờ cuộc tấn công mạng tuần trước có thể xuất phát từ một phòng thí nghiệm tiên tiến, xét theo mức độ tinh vi của tác nhân”, CEO Clement Delangue chia sẻ trên X.
Ông cho biết thêm Hugging Face đã dành cả ngày trước đó để làm việc chặt chẽ với OpenAI và “tin tưởng mạnh mẽ rằng họ không có ý định xấu”. “Thật đáng kinh ngạc khi tất cả điều này diễn ra một cách tự động”, ông nói.
OpenAI cho biết họ đã chủ động giảm bớt một số biện pháp bảo vệ an ninh mạng nhằm đánh giá năng lực của cả hai mô hình trong môi trường thử nghiệm. Tuy nhiên, các tác nhân này vẫn được vận hành trong “hộp cát” — môi trường cô lập được thiết kế để kiểm soát hệ thống và ngăn chúng truy cập internet.
Các mô hình được yêu cầu thực hiện những cuộc tấn công giả lập để đánh giá năng lực an ninh mạng. Sau đó, theo OpenAI, chúng đã tiêu tốn một lượng lớn sức mạnh tính toán để tìm cách truy cập internet mở.
Các mô hình sau đó đã “xác định và khai thác” những lỗ hổng chưa từng được biết đến để thoát khỏi hộp cát, truy cập internet và tiếp tục theo đuổi mục tiêu được giao. Quá trình này bao gồm cả việc đánh cắp thông tin đăng nhập để thực hiện cuộc tấn công.