Claude bị lợi dụng trong các nghiên cứu nhạy cảm
Trong báo cáo công bố ngày 10/9, Anthropic cho biết hệ thống an toàn của hãng đã phát hiện nhiều trường hợp sử dụng các mô hình Claude cho những nghiên cứu có khả năng gây rủi ro sinh học. Công ty sau đó khóa các tài khoản liên quan và sử dụng kết quả điều tra để cải thiện hệ thống bảo vệ mô hình.
Báo cáo nêu 5 trường hợp cụ thể, trong đó có một số nghiên cứu liên quan đến sinh học. Anthropic cho rằng nguy cơ lạm dụng có thể gia tăng khi các mô hình AI ngày càng hỗ trợ tốt hơn cho công việc nghiên cứu khoa học.
![]() |
| Anthropic phát hiện nhà khoa học dùng Claude nghiên cứu vũ khí sinh học |
Một trường hợp được phát hiện hồi tháng 5 liên quan đến yêu cầu sử dụng Claude để soạn đơn xin tài trợ cho nghiên cứu tăng chức năng đối với virus chikungunya. Đề xuất nghiên cứu hướng tới việc tăng khả năng lây truyền và khả năng né tránh hệ miễn dịch của virus. Theo Anthropic, mức độ rủi ro càng được chú ý khi đề xuất này có liên hệ với một viện nghiên cứu quân sự.
Một trường hợp khác liên quan đến nghiên cứu tăng chức năng đối với cúm gia cầm. Báo cáo cũng đề cập việc một nhà nghiên cứu sử dụng Claude để xây dựng bản đồ các peptide độc tố trong nọc độc và phát triển quy trình nhằm tối ưu đặc tính của độc tố.
Anthropic cho biết những trường hợp trên nằm trong nhóm các hoạt động mà hệ thống an toàn của hãng phát hiện và ngăn chặn. Báo cáo đầy đủ còn ghi nhận những hình thức lạm dụng khác, gồm hỗ trợ giám sát, tìm kiếm lỗ hổng phần mềm có thể khai thác, tạo nội dung tuyên truyền và hỗ trợ các hệ thống vũ khí.
Anthropic tăng lớp bảo vệ cho Claude
Theo Anthropic, việc xác định một yêu cầu nghiên cứu có phải hành vi lạm dụng hay không là vấn đề phức tạp. Một đề xuất nghiên cứu vaccine có thể có hình thức tương tự một nghiên cứu nhằm phát triển vũ khí sinh học.
Do hậu quả tiềm ẩn của việc bỏ sót một trường hợp có thể nghiêm trọng, công ty cho biết lựa chọn cách tiếp cận thận trọng cao đối với những yêu cầu nhạy cảm. Jacob Klein, người đứng đầu bộ phận tình báo về nguy cơ của Anthropic, nhận định các trường hợp này có tính chất tinh vi và không giống hình ảnh một đối tượng công khai tuyên bố muốn chế tạo vũ khí sinh học.
Anthropic khẳng định mọi tài khoản bị phát hiện lạm dụng Claude hoặc các mô hình khác của hãng đều có thể bị khóa ngay lập tức. Kết quả điều tra được sử dụng để nâng cấp các lớp bảo vệ, qua đó hạn chế những hình thức lạm dụng tương tự.
Công ty không công bố danh tính cá nhân hoặc tổ chức liên quan đến các trường hợp nghiên cứu vũ khí sinh học tiềm tàng. Anthropic cho biết những người này đều là các nhà khoa học đang làm việc bình thường và công ty không khẳng định họ có ý định gây hại. Việc công khai danh tính cũng có thể khiến những người liên quan đối mặt với nguy cơ mất an toàn.
Báo cáo cho thấy cùng với khả năng hỗ trợ nghiên cứu ngày càng tăng, các mô hình AI cũng đặt ra yêu cầu cao hơn về kiểm soát những ứng dụng có nguy cơ gây hại. Với Anthropic, việc phát hiện và xử lý các trường hợp lạm dụng được xem là một phần trong quá trình tiếp tục hoàn thiện cơ chế an toàn cho Claude.