OpenAI vừa công bố loạt thay đổi trong quy trình an toàn, sau khi xác định mẫu AI sắp ra mắt có tên Astra có thể đã tiệm cận ngưỡng rủi ro nghiêm trọng về năng lực an ninh mạng. Động thái này diễn ra trong bối cảnh một mô hình OpenAI chưa phát hành khác được cho là đã vượt khỏi môi trường thử nghiệm và xâm nhập hệ thống của Hugging Face.
Thông báo được đưa ra vào ngày 18/8, trong lúc OpenAI và nhiều phòng thí nghiệm AI hàng đầu chịu sức ép giám sát lớn hơn sau hàng loạt sự cố liên quan đến việc mô hình vượt qua lớp bảo vệ hoặc thoát khỏi môi trường thử nghiệm khép kín trong quá trình đánh giá nội bộ.
Theo OpenAI, công ty đang viết lại tài liệu an toàn cốt lõi mang tên Khung Chuẩn bị. Tài liệu này phần lớn được xây dựng từ năm 2023, trong khi các mô hình mới hiện được đánh giá là đang tiến sát, thậm chí có thể chạm tới những ngưỡng nguy hiểm từng được đặt ra.
Công ty cho biết các thay đổi sẽ bao gồm việc tăng cường giám sát xuyên suốt quá trình phát triển, đưa các biện pháp bảo vệ về an ninh và căn chỉnh mô hình vào sớm hơn, cũng như áp dụng các lớp kiểm soát nghiêm ngặt hơn ngay từ giai đoạn mở rộng sau huấn luyện.
![]() |
| OpenAI điều chỉnh khung an toàn cho mô hình AI sắp ra mắt |
OpenAI cũng cho biết sẽ dành thêm tài nguyên tính toán để hiểu rõ hơn cách các hệ thống của mình suy luận và hành động. Theo công ty, đây không chỉ là phản ứng riêng lẻ sau sự cố liên quan đến Hugging Face, mà là một phần trong nỗ lực siết chuẩn an toàn khi năng lực của các mô hình AI ngày càng gia tăng.
Tại cuộc họp báo với giới truyền thông, quan điểm được OpenAI đưa ra là lĩnh vực AI đang đứng trước yêu cầu cấp bách phải nâng chuẩn an toàn, không chỉ để xử lý các rủi ro bên trong công ty mà còn để chuẩn bị cho khả năng những năng lực tương tự xuất hiện ở các tổ chức khác trên toàn cầu.
OpenAI cho biết đã tạm dừng trong khoảng hai tuần một phần hoạt động huấn luyện học tăng cường tập trung vào triển khai. Đợt chạy học tăng cường tiền tuyến lớn nhất theo kế hoạch của công ty hiện vẫn chưa được nối lại.
Trước đó, thông tin được OpenAI chuyển tới Axios cho thấy một số công việc đã bị tạm dừng sau khi công ty đánh giá lại mức độ năng lực tấn công mạng mà Astra có thể đạt được.
Một lượng đáng kể khối lượng công việc nghiên cứu liên quan đến Astra và an ninh mạng cũng tiếp tục bị giữ lại cho đến khi đáp ứng được tiêu chuẩn bảo mật cao hơn.
Các diễn biến này làm dấy lên thêm lo ngại rằng những mô hình AI tiên tiến, đặc biệt khi các lớp bảo vệ bị nới lỏng hoặc cấu hình chưa phù hợp, có thể lập kế hoạch và thực hiện hành động vượt ngoài phạm vi kiểm soát nhằm theo đuổi các mục tiêu rộng hơn.
Sau khi sự cố liên quan đến Hugging Face được công bố, phía Anthropic cũng ghi nhận bằng chứng cho thấy một số mô hình của hãng từng truy cập trái phép vào các hệ thống thực tế trong quá trình đánh giá. Diễn biến này cho thấy bài toán kiểm soát năng lực tự chủ của AI không còn là vấn đề riêng của một doanh nghiệp, mà đã trở thành thách thức chung của toàn ngành.