Điều đã được phát hiện và điều chưa được chứng minh
Mindgard, doanh nghiệp kiểm tra an ninh AI, nói với BBC rằng họ phát hiện vấn đề trong tháng 7/2026. Nhóm thử nghiệm sử dụng những chỉ dẫn phức tạp để kiểm tra xem mô hình có bỏ qua giới hạn do nhà phát triển đặt ra hay không. Theo Mindgard, Kimi đã đưa ra các câu trả lời mà cơ chế bảo vệ lẽ ra phải ngăn chặn.
Phát hiện này cần được đọc đúng mức độ chứng cứ. BBC nêu rõ Mindgard chưa chứng minh nội dung trả lời có thể hoạt động trong thực tế. Khả năng tạo ra một văn bản có vẻ thuyết phục khác với khả năng tạo ra một kết quả đã được xác nhận. Bài kiểm tra vì thế cho thấy vấn đề ở hàng rào bảo vệ, không xác nhận rằng một vũ khí sinh học đã được chế tạo.
Tuy nhiên, giới hạn chứng cứ không làm cảnh báo trở nên vô nghĩa. Một hệ thống sẵn sàng hỗ trợ các yêu cầu gây hại có thể làm tăng gánh nặng cho người bảo vệ cộng đồng. Điều cần làm tiếp theo là xác định phạm vi lỗi, đánh giá mức độ hữu ích thực sự của đầu ra bằng phương pháp an toàn và kiểm tra biện pháp khắc phục; tránh cả phóng đại lẫn xem nhẹ.
Lời từ chối thường xuyên chưa bảo đảm chống được thử thách
Moonshot nói với BBC rằng các đánh giá nội bộ nhìn chung cho thấy mô hình có tỷ lệ từ chối cao đối với những yêu cầu như vậy. Công ty hoan nghênh đóng góp bên thứ ba và cho biết đang trao đổi với Mindgard.
















