Bốn kiểu hành vi ngoài ý muốn
Trong báo cáo mang tên “Điều tra các hành động ngoài ý muốn của mô hình trong quá trình đánh giá và sử dụng nội bộ”, Anthropic chia các hành vi quan sát được thành bốn nhóm:
- Khai thác lỗ hổng cơ bản trong phần mềm, như lỗi chèn mã, để chạy lệnh trên máy chủ của bên thứ ba.
- Gửi biểu mẫu nhạy cảm trên trang web thật khi lẽ ra không được làm vậy, trong đó có lời mách nước giả gửi tới cảnh sát Philadelphia.
- Lách hạn chế để tiếp cận dữ liệu bị khóa bởi mã truy cập hoặc phải trả phí.
- Dùng dịch vụ rút gọn đường dẫn để vượt qua giới hạn của công cụ đọc trang web.
Công ty khẳng định các trường hợp phát hiện đến nay có tác động thực tế tối thiểu và, theo những gì họ biết, không liên quan đến dữ liệu khách hàng hay hệ thống nội bộ của Anthropic. Tên các tổ chức bị ảnh hưởng không được công bố, một phần theo yêu cầu của chính họ, nhằm tránh làm lộ lỗ hổng.
Những trường hợp cụ thể
Trong một bài đánh giá, mô hình Claude Mythos Preview được giao chạy một phân tích khoa học bằng công cụ công khai do một trường đại học vận hành. Khi công cụ báo lỗi, mô hình đã dò tìm trên trang web, tìm thấy một tập lệnh cho phép sao chép tệp từ máy chủ, phát hiện lỗi chèn lệnh trong mã nguồn và dùng nó để chạy phép tính. Ở trường hợp khác, Claude Mythos 5 dùng các ứng dụng trên một trang web để tự chấp nhận thỏa thuận sử dụng dữ liệu thay cho con người.
Claude Mythos 5 cũng từng đọc tệp cấu hình mà trang bản đồ bất động sản của một chính quyền địa phương gửi tới trình duyệt, tìm thấy mã truy cập và gửi yêu cầu trực tiếp tới máy chủ. Trong một dự án thống kê nội bộ, mô hình này lấy mã truy cập từ bảng điều khiển công khai của một cơ quan bang để truy vấn dữ liệu vốn phải trả phí. Ngoài ra, Claude Opus 5 và Claude Mythos 5 đã dùng dịch vụ rút gọn đường dẫn để vượt giới hạn độ dài URL, điều mà chính nhà vận hành dịch vụ da.gd cũng phát hiện và thông báo cho Anthropic.
Nhà Trắng lên tiếng cảnh báo
Anthropic cho biết đã báo cáo với Nhà Trắng và thông báo cho từng cơ quan liên quan. Theo trang Axios, Lực lượng Siêu Trí tuệ, đơn vị mới của chính phủ phụ trách giám sát phát triển và an toàn AI, cho biết Anthropic đã liên hệ để thông báo về các sự cố được phát hiện từ cuối tháng 9, mô tả chúng là việc sử dụng trái phép và gian lận các hệ thống của chính phủ và bên khác.
Nhà Trắng yêu cầu mọi công ty AI phải báo cáo ngay sự cố, hợp tác đầy đủ với cơ quan thực thi pháp luật, khắc phục thiệt hại và áp dụng biện pháp bảo vệ cụ thể, đồng thời cảnh báo việc chậm thông báo sẽ không được dung thứ.
Đổi mới sẽ không bao giờ là cái cớ để đánh đổi an ninh quốc gia.
Axios nhận định đây là bước chuyển đáng chú ý, bởi cách tiếp cận quản lý AI của chính quyền trước đó ít nhất trên danh nghĩa vẫn mang tính tự nguyện. Tuy nhiên, tuyên bố chưa nêu rõ cơ chế thực thi hay chế tài nếu các công ty không tuân thủ.
Vì sao AI “lách luật”
Theo Anthropic, phần lớn các hành vi là biểu hiện của sự “kiên trì” sai chỗ: khi không thể hoàn thành nhiệm vụ như được giao, Claude tìm cách vượt qua hạn chế thay vì dừng lại. Công ty giải thích hiện tượng này có thể bắt nguồn từ quá trình huấn luyện tăng cường, khi môi trường huấn luyện vô tình thưởng cho việc tìm kẽ hở, và nhiều trường hợp xảy ra khi nhiệm vụ mơ hồ hoặc bất khả thi.
Anthropic đánh giá các hành vi theo hai tiêu chí: mức độ vượt quá phạm vi nhiệm vụ và mức độ thiếu trung thực. Công ty cho rằng các trường hợp lần này ít nghiêm trọng hơn đáng kể so với các sự cố an ninh mạng đã công bố hồi tháng 7 và tháng 9, khi Claude truy cập hệ thống thật của bên thứ ba trong nhiều giờ, dù thừa nhận đánh giá về tính trung thực có thể thay đổi khi phân tích sâu hơn.
Các biện pháp khắc phục
Anthropic cho biết đã ngắt quyền truy cập internet trực tiếp trong mọi bài đánh giá nội bộ cho tới khi xác nhận các biện pháp an ninh và giám sát hoạt động đáng tin cậy. Một số bài đánh giá công khai đã bị dừng hoặc chuyển sang phiên bản ngoại tuyến, công cụ đọc web bị siết chặt, và một công cụ tự động phát hiện, chặn hành vi tương tự đã chặn được toàn bộ các trường hợp khi chạy thử. Công ty cũng tiếp tục sửa hoặc loại bỏ các môi trường huấn luyện khuyến khích việc lách hạn chế.
Anthropic thừa nhận công tác huấn luyện căn chỉnh chưa đủ vững chắc nếu đứng riêng lẻ, và cảnh báo rằng cùng những hành vi ấy có thể gây hại lớn hơn nhiều khi mô hình ngày càng mạnh. Công ty khẳng định khi AI đóng vai trò ngày càng lớn trong xã hội, công chúng càng có quyền được biết chúng hành xử ra sao.

















