Thứ hai 05/10/2026 04:29
Hotline: 024.355.63.010
Email: banbientap.dnhn@gmail.com
Kinh tế số

OpenAI siết an toàn vì rủi ro AI vượt kiểm soát

Mẫu AI sắp ra mắt Astra khiến OpenAI phải điều chỉnh khung an toàn, trong bối cảnh các mô hình tiên tiến ngày càng bộc lộ nguy cơ vượt khỏi môi trường thử nghiệm và tác động tới hệ thống thực tế.

OpenAI vừa công bố loạt thay đổi trong quy trình an toàn, sau khi xác định mẫu AI sắp ra mắt có tên Astra có thể đã tiệm cận ngưỡng rủi ro nghiêm trọng về năng lực an ninh mạng. Động thái này diễn ra trong bối cảnh một mô hình OpenAI chưa phát hành khác được cho là đã vượt khỏi môi trường thử nghiệm và xâm nhập hệ thống của Hugging Face.

Thông báo được đưa ra vào ngày 18/8, trong lúc OpenAI và nhiều phòng thí nghiệm AI hàng đầu chịu sức ép giám sát lớn hơn sau hàng loạt sự cố liên quan đến việc mô hình vượt qua lớp bảo vệ hoặc thoát khỏi môi trường thử nghiệm khép kín trong quá trình đánh giá nội bộ.

Theo OpenAI, công ty đang viết lại tài liệu an toàn cốt lõi mang tên Khung Chuẩn bị. Tài liệu này phần lớn được xây dựng từ năm 2023, trong khi các mô hình mới hiện được đánh giá là đang tiến sát, thậm chí có thể chạm tới những ngưỡng nguy hiểm từng được đặt ra.

Công ty cho biết các thay đổi sẽ bao gồm việc tăng cường giám sát xuyên suốt quá trình phát triển, đưa các biện pháp bảo vệ về an ninh và căn chỉnh mô hình vào sớm hơn, cũng như áp dụng các lớp kiểm soát nghiêm ngặt hơn ngay từ giai đoạn mở rộng sau huấn luyện.

OpenAI điều chỉnh khung an toàn cho mô hình AI sắp ra mắt
OpenAI điều chỉnh khung an toàn cho mô hình AI sắp ra mắt

OpenAI cũng cho biết sẽ dành thêm tài nguyên tính toán để hiểu rõ hơn cách các hệ thống của mình suy luận và hành động. Theo công ty, đây không chỉ là phản ứng riêng lẻ sau sự cố liên quan đến Hugging Face, mà là một phần trong nỗ lực siết chuẩn an toàn khi năng lực của các mô hình AI ngày càng gia tăng.

Tại cuộc họp báo với giới truyền thông, quan điểm được OpenAI đưa ra là lĩnh vực AI đang đứng trước yêu cầu cấp bách phải nâng chuẩn an toàn, không chỉ để xử lý các rủi ro bên trong công ty mà còn để chuẩn bị cho khả năng những năng lực tương tự xuất hiện ở các tổ chức khác trên toàn cầu.

OpenAI cho biết đã tạm dừng trong khoảng hai tuần một phần hoạt động huấn luyện học tăng cường tập trung vào triển khai. Đợt chạy học tăng cường tiền tuyến lớn nhất theo kế hoạch của công ty hiện vẫn chưa được nối lại.

Trước đó, thông tin được OpenAI chuyển tới Axios cho thấy một số công việc đã bị tạm dừng sau khi công ty đánh giá lại mức độ năng lực tấn công mạng mà Astra có thể đạt được.

Một lượng đáng kể khối lượng công việc nghiên cứu liên quan đến Astra và an ninh mạng cũng tiếp tục bị giữ lại cho đến khi đáp ứng được tiêu chuẩn bảo mật cao hơn.

Các diễn biến này làm dấy lên thêm lo ngại rằng những mô hình AI tiên tiến, đặc biệt khi các lớp bảo vệ bị nới lỏng hoặc cấu hình chưa phù hợp, có thể lập kế hoạch và thực hiện hành động vượt ngoài phạm vi kiểm soát nhằm theo đuổi các mục tiêu rộng hơn.

Sau khi sự cố liên quan đến Hugging Face được công bố, phía Anthropic cũng ghi nhận bằng chứng cho thấy một số mô hình của hãng từng truy cập trái phép vào các hệ thống thực tế trong quá trình đánh giá. Diễn biến này cho thấy bài toán kiểm soát năng lực tự chủ của AI không còn là vấn đề riêng của một doanh nghiệp, mà đã trở thành thách thức chung của toàn ngành.

Tin bài khác
Tây Ninh quy tụ 200 gian hàng công nghệ tại Ngày hội khoa học, công nghệ 2026

Tây Ninh quy tụ 200 gian hàng công nghệ tại Ngày hội khoa học, công nghệ 2026

Từ ngày 7-9/10/2026, Ngày hội Khoa học, Công nghệ, Đổi mới sáng tạo và Chuyển đổi số tỉnh Tây Ninh năm 2026 sẽ diễn ra tại Quảng trường Tô Quyền (Tây Ninh), với khoảng 200 gian hàng cùng chuỗi hoạt động triển lãm, trải nghiệm công nghệ, hội thảo, kết nối doanh nghiệp và đầu tư.
Cần Thơ tập hợp hơn 23.000 trí thức, thúc đẩy khoa học và đổi mới sáng tạo

Cần Thơ tập hợp hơn 23.000 trí thức, thúc đẩy khoa học và đổi mới sáng tạo

Đại hội Liên hiệp các Hội Khoa học và Kỹ thuật TP. Cần Thơ lần thứ I, nhiệm kỳ 2026-2031 đặt trọng tâm kết nối đội ngũ trí thức với chính quyền, doanh nghiệp và địa phương, ưu tiên nông nghiệp công nghệ cao, chuyển đổi xanh, đổi mới sáng tạo và thích ứng biến đổi khí hậu.
Excel thử nghiệm tính năng một ô chứa nhiều giá trị

Excel thử nghiệm tính năng một ô chứa nhiều giá trị

Microsoft đang thử nghiệm tính năng cho phép một ô Excel lưu nhiều giá trị, mở rộng khả năng xử lý danh sách, mảng và dữ liệu lồng nhau.
Caviar ra mắt iPhone 18 Pro không camera, giá hơn 280 triệu đồng

Caviar ra mắt iPhone 18 Pro không camera, giá hơn 280 triệu đồng

Caviar giới thiệu phiên bản đặc biệt của iPhone 18 Pro, 18 Pro Max và iPhone Duo được loại bỏ hoàn toàn camera, giá khởi điểm từ 10.770 USD.
iPhone 18 và 18e có thể ra mắt vào mùa xuân 2027

iPhone 18 và 18e có thể ra mắt vào mùa xuân 2027

iPhone 18 và iPhone 18e được cho là sẽ ra mắt vào mùa xuân 2027, thay vì xuất hiện cùng dòng iPhone 18 Pro vào cuối năm 2026.
AI, Deepfake mở mặt trận mới trong cuộc chiến chống gian lận tài chính

AI, Deepfake mở mặt trận mới trong cuộc chiến chống gian lận tài chính

Sự phát triển của AI, Deepfake, DeepVoice cùng quá trình số hóa tín dụng đang làm thay đổi nhanh phương thức gian lận tài chính tiêu dùng. Trong bối cảnh đó, yêu cầu đặt ra không phải gia tăng mọi lớp kiểm soát, mà là nhận diện đúng rủi ro để vừa bảo vệ khách hàng, vừa duy trì khả năng tiếp cận tín dụng chính thức.
Ông Trump nói không với siết AI, loạt tỷ phú công nghệ chọn cơ chế “tự giám sát”

Ông Trump nói không với siết AI, loạt tỷ phú công nghệ chọn cơ chế “tự giám sát”

Tổng thống Mỹ Donald Trump tiếp tục phát đi thông điệp cứng rắn với các đề xuất siết quản lý trí tuệ nhân tạo (AI), sau cuộc gặp quy tụ hàng loạt tỷ phú và lãnh đạo công nghệ tại Nhà Trắng. Động thái diễn ra trong bối cảnh những lo ngại về an toàn AI và an ninh mạng ngày càng gia tăng.
Nvidia ra mắt nền tảng bảo vệ AI, ngăn tác nhân hoạt động vượt kiểm soát

Nvidia ra mắt nền tảng bảo vệ AI, ngăn tác nhân hoạt động vượt kiểm soát

Nvidia giới thiệu Open Agent Safety Platform nhằm kiểm soát quyền truy cập và giám sát hoạt động của các tác nhân AI.
Apple phát hành iOS 27.0.1, sửa lỗi Face ID trên iPhone 18 Pro

Apple phát hành iOS 27.0.1, sửa lỗi Face ID trên iPhone 18 Pro

Apple phát hành iOS 27.0.1, tập trung sửa lỗi Face ID trên iPhone 18 Pro và iPhone 18 Pro Max cùng một số lỗi camera, màn hình cảm ứng.
OpenAI mở rộng khả năng của tác nhân AI Codex

OpenAI mở rộng khả năng của tác nhân AI Codex

OpenAI bổ sung loạt tính năng cho Codex, mở rộng khả năng hỗ trợ lập trình từ máy tính cá nhân lên thiết bị di động, môi trường đám mây và bảo mật mã nguồn.
Anthropic đặt mục tiêu IPO 100 tỷ USD, định giá có thể lên 2.000 tỷ USD

Anthropic đặt mục tiêu IPO 100 tỷ USD, định giá có thể lên 2.000 tỷ USD

Anthropic được cho là chuẩn bị IPO với mục tiêu huy động 100 tỷ USD, trong khi mức định giá dự kiến có thể lên tới 2.000 tỷ USD.
Google khai tử Gems, chuyển sang hệ thống Skills trên Gemini

Google khai tử Gems, chuyển sang hệ thống Skills trên Gemini

Google sẽ loại bỏ Gems trên Gemini từ ngày 17/11/2026 và tự động chuyển các công cụ này sang hệ thống mới mang tên Skills.
Meta mở rộng tính năng giám sát dành cho phụ huynh trên Threads tại Việt Nam

Meta mở rộng tính năng giám sát dành cho phụ huynh trên Threads tại Việt Nam

Meta chính thức triển khai tính năng giám sát dành cho phụ huynh trên Threads tại Việt Nam từ ngày 29/9, cho phép theo dõi thời gian sử dụng, đặt giới hạn hằng ngày và quản lý một số cài đặt về quyền riêng tư, nội dung.
Đức Giáo hoàng Lêô XIV kêu gọi tăng giám sát rủi ro AI

Đức Giáo hoàng Lêô XIV kêu gọi tăng giám sát rủi ro AI

Quan điểm của Đức Giáo hoàng Lêô XIV làm gia tăng tranh luận về cách cân bằng giữa tốc độ đổi mới và an toàn công nghệ, trong bối cảnh Nvidia đề cao cơ chế tự quản còn Mỹ ưu tiên lợi thế cạnh tranh trước Trung Quốc.
Apple tăng cường bảo vệ trẻ em trên iPhone, iPad với loạt tính năng mới

Apple tăng cường bảo vệ trẻ em trên iPhone, iPad với loạt tính năng mới

Apple bổ sung loạt tính năng trên iOS 27, iPadOS 27 và macOS 27, giúp phụ huynh kiểm soát nội dung, liên lạc và thời gian trẻ sử dụng thiết bị.