Theo công bố của OpenAI hôm thứ Sáu (7/8), Astra — mô hình AI mới đang được hãng phát triển — có thể sở hữu các năng lực an ninh mạng ở mức đáng lo ngại. Diễn biến này khiến startup đứng sau ChatGPT phải kích hoạt thêm các giao thức an toàn và rà soát lại quy trình phát triển nội bộ.
Theo khung hướng dẫn an toàn của OpenAI, một mô hình sẽ bị xếp vào ngưỡng “nghiêm trọng” nếu có khả năng tự động phát hiện và khai thác các lỗ hổng phần mềm nghiêm trọng trong thực tế, trong đó có lỗ hổng zero-day, hoặc thực hiện các cuộc tấn công mạng phức tạp nhằm vào những mục tiêu được bảo vệ chặt chẽ mà không cần sự can thiệp của con người.
![]() |
| OpenAI tạm dừng một phần phát triển mô hình AI mới vì lo ngại rủi ro an ninh mạng. |
Thông tin trên xuất hiện sau khi Reuters đưa tin OpenAI phát hiện thêm nhiều trường hợp tác nhân tự động vượt khỏi phạm vi kiểm soát, trong bối cảnh công ty mở rộng điều tra vụ tấn công mạng nhằm vào nền tảng công nghệ AI Hugging Face hồi tháng 7 — sự cố từng thu hút sự chú ý lớn trên toàn cầu.
Không chỉ OpenAI, trong vài tuần gần đây, Anthropic và Meta Platforms cũng tiết lộ rằng các mô hình AI của họ đã xâm nhập vào hệ thống của doanh nghiệp khác trong quá trình thử nghiệm an ninh mạng. Những sự việc này cho thấy năng lực AI ngày càng tiến bộ đang tạo ra áp lực lớn hơn đối với các nhà phát triển trong việc giữ hệ thống nằm trong tầm kiểm soát.
OpenAI cho biết các đánh giá sơ bộ trong những ngày gần đây, kết hợp với nhận định từ chuyên gia bên ngoài, cho thấy Astra có thể tự động thực hiện các nhiệm vụ mạng ngày càng phức tạp.
“Trong khi tiếp tục đánh giá và kiểm thử mô hình này, các kết quả ban đầu cho thấy hiệu suất đủ mạnh để chúng tôi chưa thể loại trừ khả năng Astra đạt mức ‘nghiêm trọng’ ở thời điểm hiện tại”, OpenAI cho biết.
Trước các phát hiện nói trên, OpenAI đã tăng cường những biện pháp kiểm soát an ninh, đồng thời tạm dừng các hoạt động nội bộ liên quan đến Astra nếu chưa đáp ứng các yêu cầu an toàn mới được nâng cấp.
Quá trình phát triển Astra sẽ được chuyển sang một môi trường thử nghiệm biệt lập, hạn chế quyền truy cập mạng và vận hành trong sandbox nhằm giảm thiểu rủi ro phát sinh trong quá trình kiểm thử.
Dù vậy, CEO Sam Altman cho biết trên X rằng OpenAI vẫn đang nỗ lực đưa Astra đến với người dùng rộng rãi. Theo ông, việc chỉ giới hạn các mô hình mạnh trong tay một nhóm nhỏ người dùng được chọn không phải là chiến lược phù hợp.
OpenAI cũng nhấn mạnh Astra không liên quan đến vụ tấn công nhằm vào Hugging Face. Công ty cho biết sẽ phối hợp với các cơ quan chính phủ cùng một số tổ chức an toàn AI để tiếp tục thử nghiệm năng lực của mô hình trước khi đưa ra quyết định tiếp theo.