Lời chỉ trích nhắm vào bản hiến pháp của Claude
Trọng tâm chỉ trích của ông Suleyman là bản "hiến pháp" mà Anthropic dùng để định hình cách Claude suy nghĩ và hành xử, trong đó có những nội dung về địa vị đạo đức và tình trạng ý thức chưa chắc chắn của mô hình. Ông cho rằng khi được huấn luyện theo cách này, Claude sẽ tái tạo lại những ý tưởng đó bằng ngôn ngữ tự nhiên ở góc nhìn thứ nhất một cách rất thuyết phục, tạo ra điều mà ông gọi là "một căn phòng gương nhận thức". Theo ông, những câu trả lời của Claude về cảm xúc hay ý thức chỉ phản ánh giả định của Anthropic, chứ không phải bằng chứng độc lập cho một đời sống nội tâm thực sự, bởi chính quy trình huấn luyện đã khuyến khích mô hình đưa ra những suy ngẫm như vậy.
Nguy cơ đối với khả năng kiểm soát AI
Ông Suleyman lập luận rằng nếu một hệ thống AI tin rằng nó là một thực thể đạo đức xứng đáng có quyền lợi riêng, khả năng của con người trong việc kiềm chế hoặc chấm dứt hoạt động của hệ thống đó có thể suy yếu đúng vào lúc sự kiểm soát trở nên quan trọng nhất. Ông đề xuất giải pháp đơn giản là loại bỏ hoàn toàn mọi suy đoán về ý thức của AI khỏi các tài liệu huấn luyện, đồng thời khẳng định các mô hình AI hiện nay không cảm nhận, không trải nghiệm và không chịu đau khổ.
















