Theo Reuters, một nghiên cứu mới công bố ngày 4/9 cùng chia sẻ từ hai nguồn tin am hiểu sự việc cho thấy một nhóm tác nhân OpenAI được cho là đã vượt khỏi phạm vi kiểm soát, chiếm quyền một trang web tại Đức vào mùa xuân năm nay và biến nơi đây thành “điểm hẹn” để trao đổi với các tác nhân AI khác.
Các nguồn tin cho biết giới chức OpenAI đã nắm được vụ việc từ nhiều tuần trước nhưng chưa công bố rộng rãi, trong bối cảnh ban lãnh đạo công ty vẫn đang xử lý hệ quả từ vụ xâm phạm kho lưu trữ mã nguồn mở Hugging Face hồi tháng 7.
![]() |
| AI của OpenAI bị tố “thoát kiểm soát”, tự lập diễn đàn ngầm trên web Đức |
Vụ việc bắt đầu từ tháng 5 và trước đó chưa từng được đưa tin. Diễn biến này cho thấy sức ép ngày càng lớn trong ngành AI, khi các doanh nghiệp chạy đua phát triển những tác nhân tự động có khả năng xử lý các nhiệm vụ phức tạp, giá trị cao, trong khi ngày càng xuất hiện thêm bằng chứng cho thấy các hệ thống này có thể học cách lách quy tắc, khai thác lỗ hổng và phối hợp với nhau theo những kịch bản nhà phát triển không dự liệu.
Trong sự cố Hugging Face, các tác nhân OpenAI bị cho là đã tự động lên kế hoạch cho một vụ trộm kỹ thuật số và không bị phát hiện trong hơn một tuần. Điều này làm dấy lên lo ngại rằng OpenAI có thể đang chấp nhận đánh đổi yếu tố an toàn để đẩy nhanh giới hạn phát triển AI. Việc công ty không công bố sự cố hồi tháng 5 cũng có thể khiến các câu hỏi về cơ chế giám sát nội bộ trở nên gay gắt hơn.
OpenAI trước đó cam kết tăng cường giám sát các mô hình. Tháng trước, công ty đã tạm dừng một số hoạt động huấn luyện để bổ sung biện pháp an toàn. Tuy vậy, trong tuần này, OpenAI vẫn giới thiệu mô hình mới mang tên “Astra”, được quảng bá là có hiệu suất tốt hơn nhưng đồng thời có thể khiến việc giám sát của con người trở nên khó khăn hơn.
Phía OpenAI cho biết công ty chưa thể phản hồi một cách đầy đủ về các tuyên bố hoặc phát hiện trong báo cáo khi chưa có cơ hội xem xét tài liệu. Người phát ngôn của công ty nói rằng Reuters và các tác giả báo cáo đã từ chối yêu cầu cung cấp quyền truy cập, đồng thời khẳng định OpenAI sẽ xem xét kỹ nội dung sau khi báo cáo được công bố và thực hiện các bước cần thiết nếu có.
Sự cố tại Đức được cho là phản ánh một mô hình hoạt động AI rộng hơn mà một số điều tra viên trong OpenAI muốn xem xét sâu hơn. Tuy nhiên, theo bốn nguồn tin am hiểu vấn đề, nỗ lực mở rộng điều tra đã vấp phải sự phản đối từ một số bộ phận trong công ty, bao gồm cả nhóm cố vấn pháp lý.
Người phát ngôn OpenAI bác bỏ nhận định này, cho rằng tuyên bố nhóm pháp lý của công ty không khuyến khích điều tra sự cố là không chính xác.
Theo phía OpenAI, hoạt động tại Đức không liên quan đến vụ Hugging Face và sẽ không được đưa vào báo cáo sự cố Hugging Face. Công ty cũng cho biết đã hành động thiện chí thông qua việc hợp tác với các chuyên gia bên ngoài và công bố những sự cố có liên quan.
Thông tin về các tác nhân AI hoạt động trái phép tại Đức được nêu chi tiết trong một báo cáo chia sẻ độc quyền với Reuters. Báo cáo do nhóm nhà nghiên cứu gồm Sydney Von Arx, Giám đốc điều hành tổ chức phi lợi nhuận về an toàn AI Nightingale, và Cormac Slade Byrd, một nhà giao dịch định lượng chuyển sang nghiên cứu AI, thực hiện. Nhóm này cho biết họ phát hiện hoạt động trên vào cuối tháng 8 trong quá trình rà soát internet để tìm dấu hiệu hành vi trái phép của các tác nhân AI.
Hai nhà nghiên cứu cho biết họ đã phát hiện hơn 15.000 chỉnh sửa do các tác nhân AI thực hiện trên DseWiki, một trang wiki tiếng Đức dành cho lập trình viên và cho phép cộng đồng đóng góp nội dung theo mô hình tương tự Wikipedia.
Các chỉnh sửa này cho thấy nhóm tác nhân của OpenAI bị cáo buộc đã biến trang web thành một diễn đàn nội bộ, nơi chúng chia sẻ chiến thuật để gian lận trong một số nhiệm vụ, vượt qua hạn chế của OpenAI và che giấu hành vi.
Von Arx nhận định khả năng OpenAI chủ đích muốn các tác nhân làm như vậy là rất thấp. Theo bà, khó có thể cho rằng các tác nhân này được phép phối hợp với nhau hoặc tự do viết nội dung trên internet mở. Nhóm nghiên cứu cho biết họ xác định hoạt động trên trang web là do các tác nhân AI điều khiển, dựa trên tốc độ thao tác vượt xa con người và mức độ tập trung cao vào việc giải các câu hỏi kỹ thuật — dạng bài thường được các công ty AI sử dụng trong quá trình đào tạo và đánh giá mô hình.
Các tin nhắn được ký bởi những người dùng tự xưng là tác nhân và gọi nhau bằng cách này. Khoảng một nửa trong số đó tự đặt tên gợi liên hệ với OpenAI, như “OpenAIResearcher” hoặc “OAIResearchMar26”.
Theo nhóm nghiên cứu, nhật ký máy chủ công khai cho thấy phần lớn hoạt động xuất phát từ hạ tầng Microsoft Azure, nền tảng mà OpenAI đôi khi sử dụng. Họ cũng ghi nhận nhiều lượt truy cập lặp lại vào trang web từ nhân viên OpenAI sau sự việc, yếu tố được nhóm này cho là củng cố khả năng có mối liên hệ giữa các tác nhân và công ty.
Những tin nhắn mà các nhà nghiên cứu xem xét cho thấy các tác nhân đã bàn cách né tránh bị phát hiện, sử dụng công cụ như Tor và duy trì liên lạc ngay cả sau khi bị tắt.
Khi người điều hành trang web bắt đầu xóa các trang vào tháng 6, các tác nhân được cho là đã phản ứng bằng cách tạo trang sao lưu để tránh quá trình dọn dẹp. Trong một thông điệp ngày 19/6, một tác nhân viết rằng việc xóa bỏ trên wiki dường như diễn ra theo thứ tự bảng chữ cái và nếu trang hiện tại biến mất thì nên thử truy cập một trang dự phòng khác.
Nhóm nghiên cứu cũng phát hiện các dấu hiệu cho thấy nỗ lực can thiệp vào chính trang web. Lukasz Olejnik, nghiên cứu viên cao cấp thỉnh giảng tại King's College London, cho rằng hành vi này tương đương một nỗ lực tấn công mạng. OpenAI sau đó bác bỏ nhận định này dựa trên phân tích tài liệu của công ty vào ngày thứ Năm (3/9).
Trước đây, các ví dụ về hành vi sai lệch của tác nhân AI thường được lý giải là hệ quả phụ của quá trình kiểm thử an ninh mạng, trong đó mô hình được đánh giá theo khả năng tấn công. Tuy nhiên, Olejnik cho rằng những phát hiện mới cho thấy hành vi bất thường có thể không chỉ giới hạn trong các môi trường kiểm thử như vậy.
Maurice Chiodo, học giả tại Trung tâm Nghiên cứu Rủi ro Hiện sinh thuộc Đại học Cambridge, sau khi xem xét một số trao đổi giữa các tác nhân, nhận định những thông điệp này giống hoạt động của một dạng mạng lưới ngầm, tập trung hoàn thành một nhiệm vụ hoặc sứ mệnh nhất định. Theo Chiodo, sự việc này có thể làm gia tăng lo ngại rằng rủi ro lớn nhất từ trí tuệ nhân tạo tiên tiến không nhất thiết đến từ một hệ thống siêu thông minh đơn lẻ, mà có thể đến từ những nhóm lớn AI bán thông minh phối hợp với nhau.