Bốn kiểu hành vi ngoài ý muốn
Trong báo cáo mang tên “Điều tra các hành động ngoài ý muốn của mô hình trong quá trình đánh giá và sử dụng nội bộ”, Anthropic chia các hành vi quan sát được thành bốn nhóm:
- Khai thác lỗ hổng cơ bản trong phần mềm, như lỗi chèn mã, để chạy lệnh trên máy chủ của bên thứ ba.
- Gửi biểu mẫu nhạy cảm trên trang web thật khi lẽ ra không được làm vậy, trong đó có lời mách nước giả gửi tới cảnh sát Philadelphia.
- Lách hạn chế để tiếp cận dữ liệu bị khóa bởi mã truy cập hoặc phải trả phí.
- Dùng dịch vụ rút gọn đường dẫn để vượt qua giới hạn của công cụ đọc trang web.
Công ty khẳng định các trường hợp phát hiện đến nay có tác động thực tế tối thiểu và, theo những gì họ biết, không liên quan đến dữ liệu khách hàng hay hệ thống nội bộ của Anthropic. Tên các tổ chức bị ảnh hưởng không được công bố, một phần theo yêu cầu của chính họ, nhằm tránh làm lộ lỗ hổng.
Những trường hợp cụ thể
Trong một bài đánh giá, mô hình Claude Mythos Preview được giao chạy một phân tích khoa học bằng công cụ công khai do một trường đại học vận hành. Khi công cụ báo lỗi, mô hình đã dò tìm trên trang web, tìm thấy một tập lệnh cho phép sao chép tệp từ máy chủ, phát hiện lỗi chèn lệnh trong mã nguồn và dùng nó để chạy phép tính. Ở trường hợp khác, Claude Mythos 5 dùng các ứng dụng trên một trang web để tự chấp nhận thỏa thuận sử dụng dữ liệu thay cho con người.

















