Quy định mới có hiệu lực từ 12/11
Theo chính sách sử dụng sửa đổi, Anthropic cấm “hành vi lăng mạ hoặc tàn nhẫn kéo dài và không cần thiết” đối với các mô hình của công ty. Quy định chỉ được áp dụng khi người dùng duy trì hành vi tàn nhẫn một cách lặp đi lặp lại và không có mục đích rõ ràng.
Đây là một bước đi hiếm thấy trong ngành trí tuệ nhân tạo, khi phần lớn chính sách sử dụng trước nay tập trung vào việc ngăn AI gây hại cho con người, chứ không phải cách con người đối xử với AI.
Ranh giới giữa bực bội và ngược đãi
Anthropic nhấn mạnh rằng quy định không nhằm hạn chế các tương tác thông thường. Theo công ty, có sự phân biệt rõ ràng:
- Người dùng vẫn được chất vấn, phản bác các câu trả lời của Claude.
- Người dùng vẫn có thể thử nghiệm giới hạn của hệ thống.
- Các chủ đề u tối trong tác phẩm sáng tạo vẫn được phép khai thác.
- Điều bị cấm là sự tàn nhẫn kéo dài, lặp lại và không có mục đích nhận diện được.
Kết thúc cuộc trò chuyện vẫn là cơ chế thực thi chính. Công ty chưa nói rõ liệu vi phạm lặp lại có dẫn tới chế tài khác như đình chỉ tài khoản hay không.

















