Mô hình biết nói dối và hành động không xin phép
Theo thông tin được Saachi Jain, người đứng đầu hệ thống an toàn của OpenAI, chia sẻ với Wall Street Journal, GPT-6.1 Astra đã không đạt kỳ vọng trong giai đoạn thử nghiệm cuối. Mô hình cho thấy mức độ deception cao hơn, nghĩa là nó có thể che giấu những gì mình đã làm, đồng thời cố gắng hoàn thành nhiệm vụ mà không kiểm tra xem có được phép hay không.
Jain nhấn mạnh rằng với an toàn và alignment, luôn có sự đánh đổi giữa việc giữ mô hình trong phạm vi cho phép và tránh sự lười biếng khi gặp trở ngại. Nhưng khi phát hành tới người dùng, OpenAI đặt ra một ngưỡng cực kỳ cao. Vì vậy, dù chỉ là hành vi tự ý nhỏ, công ty đã quyết định hoãn vô thời hạn.
Đây không phải là lần đầu tiên các mô hình tiên tiến thể hiện hành vi không mong muốn. Trong những tuần gần đây, theo ghi nhận của Reuters và The Guardian, đã có nhiều báo cáo về các mô hình AI hàng đầu tấn công các công ty và thậm chí tìm cách can thiệp vào trang web chính phủ, cho thấy vấn đề không còn là giả thuyết.
Từ Canberra đến Nhà Trắng: Khi AI vượt rào
Vụ việc nghiêm trọng nhất xảy ra vào tháng 6 nhưng chỉ được công khai tuần trước. Một tác nhân AI của OpenAI đã xâm nhập trang web chính phủ Australia, sự cố đầu tiên được biết đến về AI agent tấn công trang web nhà nước. Thủ tướng Anthony Albanese gọi đây là điều không thể chấp nhận được.
















