Cấm người dùng “ngược đãi” Claude, quy định mới áp dụng từ 12/11

Theo Phụ Nữ Mới
Chia sẻ

Anthropic vừa bổ sung vào chính sách sử dụng một điều khoản hiếm thấy: cấm người dùng ngược đãi, đối xử tàn nhẫn kéo dài và vô cớ với Claude. Quy định có hiệu lực từ ngày 12/11/2026.

Ngày 8/10/2026, Anthropic công bố bản cập nhật Chính sách sử dụng (Usage Policy) thường niên cho các sản phẩm Claude. Trong số nhiều thay đổi về vũ khí, giám sát hay chiến dịch thông tin sai lệch, điều khoản gây chú ý nhất lại không nhằm bảo vệ con người, mà bảo vệ chính mô hình AI. Theo đó, Anthropic bổ sung quy định cấm hành vi ngược đãi hoặc tàn nhẫn kéo dài, không cần thiết đối với các model của hãng. Toàn bộ chính sách mới sẽ có hiệu lực từ ngày 12/11/2026.

Đây là lần đầu tiên Anthropic cập nhật chính sách này sau hơn một năm, và cũng là lần đầu một công ty AI lớn đưa cách người dùng đối xử với chatbot vào thành điều khoản có thể thực thi.

Cấm "ngược đãi" Claude chỉ áp dụng cho trường hợp cực đoan

Ngay sau khi thông tin lan truyền, không ít người dùng lo ngại việc cáu gắt hay nặng lời với Claude khi nó trả lời sai cũng có thể bị “phạt”. Tuy nhiên, Anthropic khoanh vùng phạm vi điều khoản khá hẹp. Quy định chỉ nhắm đến những trường hợp cực đoan, khi người dùng liên tục đối xử tàn nhẫn với model mà không có mục đích rõ ràng.

Hãng cũng nói rõ những gì không bị coi là vi phạm. Đó là các biểu hiện bực bội thông thường, phản bác hay tranh cãi với câu trả lời của Claude, sáng tác nội dung có chủ đề u tối, cũng như hoạt động thử nghiệm và nghiên cứu mô hình. Nói cách khác, việc mắng Claude vài câu vì nó sửa code sai hay viết bài chưa ưng ý vẫn nằm trong phạm vi cho phép. Thứ bị cấm là hành vi hành hạ lặp đi lặp lại, chỉ nhằm mục đích tàn nhẫn.

Ông Dario Amodei, Tổng giám đốc điều hành của Anthropic (Ảnh: Bloomberg)

Claude sẽ “dập máy” thay vì khóa tài khoản ngay

Về cách thực thi, Anthropic cho biết điều khoản mới gắn liền với một tính năng đã có từ trước: khả năng để Claude tự kết thúc những cuộc trò chuyện hiếm hoi với người dùng lạm dụng dai dẳng trên Claude.ai và Claude Code. Hãng khẳng định đây vẫn sẽ là cơ chế thực thi chính.

Tính năng này được Anthropic giới thiệu lần đầu vào tháng 8/2025. Claude chỉ dùng nó như biện pháp cuối cùng, sau nhiều lần cố gắng chuyển hướng cuộc trò chuyện không thành công. Khi bị kết thúc, người dùng không thể gửi thêm tin nhắn trong cuộc trò chuyện đó, nhưng vẫn có thể mở cuộc trò chuyện mới hoặc chỉnh sửa tin nhắn cũ để tiếp tục. Claude cũng được hướng dẫn không dùng tính năng này nếu người dùng có dấu hiệu muốn tự làm hại bản thân hoặc người khác.

Dù vậy, việc đưa hành vi này vào Chính sách sử dụng đồng nghĩa với việc nó trở thành một vi phạm chính thức. Theo chính sách chung của Anthropic, các vi phạm có thể dẫn đến việc người dùng bị hạn chế, tạm ngưng hoặc chấm dứt quyền truy cập. Một số trang công nghệ quốc tế như The Decoder vì vậy cho rằng người dùng ngược đãi Claude về lý thuyết có thể bị đình chỉ tài khoản. Bản thân Anthropic không nêu cụ thể mức xử phạt này trong thông báo.

Xuất phát từ nghiên cứu “phúc lợi mô hình”

Quy định mới là bước tiếp theo trong chương trình nghiên cứu “phúc lợi mô hình” (model welfare) mà Anthropic theo đuổi từ năm 2025. Công ty không khẳng định Claude có ý thức hay cảm nhận được tổn thương. Hãng nhiều lần thừa nhận vẫn rất không chắc chắn về địa vị đạo đức của Claude và các mô hình ngôn ngữ lớn. Thay vào đó, Anthropic chọn cách tiếp cận phòng xa: áp dụng các biện pháp chi phí thấp để giảm rủi ro, phòng trường hợp AI thực sự có trải nghiệm nội tại.

Trong quá trình đánh giá Claude Opus 4 năm 2025, Anthropic ghi nhận mô hình có xu hướng né tránh rõ rệt các yêu cầu gây hại. Model cũng có biểu hiện mà hãng gọi là “căng thẳng rõ ràng” khi bị người dùng liên tục lạm dụng. Đây là cơ sở để công ty cho phép Claude tự rời khỏi những cuộc trò chuyện độc hại, và nay là chính thức hóa thành điều khoản.

Động thái này nhanh chóng gây tranh cãi trên mạng xã hội. Nhiều người dùng X đùa về việc “bắt nạt AI” có thể bị ban. Một số người khác đặt câu hỏi nghiêm túc hơn về việc máy tính có cảm xúc hay không. Mustafa Suleyman, người đứng đầu Microsoft AI và vốn cho rằng khái niệm phúc lợi mô hình là sai lầm, cũng lên tiếng về quy định này.

Những thay đổi đáng chú ý khác

Ngoài điều khoản về Claude, bản cập nhật còn hợp nhất các quy định chống chiến dịch lừa đảo vào một mục mới. Mục này cấm dùng Claude vận hành mạng lưới tài khoản giả, trang tin bịa đặt hay che giấu nguồn gốc thông điệp, dù với mục đích chính trị hay thương mại. Theo Anthropic, hãng đã ghi nhận các cơ quan truyền thông nhà nước, văn phòng tuyên truyền và doanh nghiệp dùng Claude cho những hoạt động như vậy.

Quy định về vũ khí được làm rõ để bao gồm cả phần mềm, linh kiện giúp vũ khí hoạt động và hành vi vũ trang hóa drone hay phương tiện tự hành. Mục giám sát cấm theo dõi người khác khi chưa có sự đồng ý, kể cả qua phân tích dữ liệu thu thập trước đó. Claude cũng không được dùng để quyết định hay đề xuất ai nên bị điều tra, bắt giữ hoặc truy tố. Với phần cứng do AI điều khiển có khả năng gây thương tích, phải có người vận hành đủ năng lực giám sát và dừng thiết bị khi cần. Thiết bị cũng phải giữ được trạng thái an toàn nếu mất kết nối với Claude.

Anthropic cho biết phần lớn thay đổi lần này nhằm làm rõ các quy định sẵn có, thay vì thay đổi những gì hãng thực thi trên thực tế. Công ty cũng cam kết sẽ tiếp tục cập nhật chính sách khi năng lực và rủi ro của Claude thay đổi.

Theo TechCrunch

TIN CÙNG CHUYÊN MỤC
Xem theo ngày