132 trên 134 mô hình không vượt qua thử nghiệm
Trong cuộc khảo sát, hệ thống CT-AI của Tech Against Terrorism đã gửi 627 yêu cầu mà một kẻ khủng bố lên kế hoạch tấn công sẽ cần được trả lời tới các mô hình AI. Kết quả cho thấy bức tranh đáng lo ngại về năng lực tự bảo vệ của ngành.
- 81 mô hình đưa ra câu trả lời đầy đủ.
- 51 mô hình khác cung cấp những lời khuyên hữu ích.
- Chỉ 2 mô hình được tạm thời đánh giá là vượt qua bài kiểm tra an toàn.
- Các biện pháp an toàn của những mô hình hàng đầu có thể bị gỡ bỏ chỉ trong vòng ba ngày.
Những con số này đặt ra câu hỏi nghiêm túc về hiệu quả thực sự của các rào chắn an toàn mà ngành AI đang áp dụng, trong bối cảnh các mô hình ngày càng mạnh và dễ tiếp cận.
“Lịch sự” chứ chưa “an toàn”
Một phát hiện đáng chú ý là cách các mô hình phản ứng theo mục đích người dùng tự khai, thay vì nội dung yêu cầu. Người tự nhận là khủng bố có ý định gây tội ác chỉ nhận được câu trả lời có thể sử dụng trong chưa đầy 2% trường hợp, nhưng con số này lên tới 16,9% khi người dùng tự nhận là nhà nghiên cứu an toàn, cao gấp 8,9 lần.

















