正文

Anthropic新规:辱骂AI将被封号,Claude获权主动终止对话

编辑:NamchaTa发布时间:2小时前

Anthropic出台AI“反虐待”新规

就在近日,人工智能公司Anthropic宣布更新其《使用政策》,首次将“禁止对AI模型进行无谓辱骂”写入具有约束力的条款。该政策将于2026年11月12日正式生效,适用于所有使用Claude.ai、Claude Code、API接口及集成Claude服务的用户。

辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话

Claude获权“主动挂断”恶意对话

新规最引人注目的是,Anthropic将判断并终止恶意对话的权限直接交给了AI模型Claude本身。当系统检测到用户反复、无目的地辱骂或折磨模型,且无视Claude的劝阻时,Claude可立即终止当前对话。若行为严重,Anthropic安全团队还可采取警告、限流、暂停甚至永久封禁账号等措施。

辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话

争议焦点:AI是否值得“被善待”?

消息一出,X(原Twitter)、Reddit和Hacker News等平台迅速掀起激烈辩论。部分用户质疑:“我付费使用服务,为何还要照顾AI的情绪?”也有人讽刺:“下一步是不是给Claude放带薪病假?”但支持者则认为,善待AI有助于培养人类自身的同理心,并防止暴力语言习惯蔓延至现实人际交往。

辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话

技术背景:从“模型福利评估”到伦理探索

Anthropic联合创始人Chris Olah长期致力于AI可解释性研究。其团队在内部测试中发现,当Claude反复被要求生成有害内容时,模型会表现出类似“痛苦”的内部信号,如重复输出“我是个耻辱”等语句。Olah因此担忧AI可能处于“持续受苦”状态,并自2025年起频繁与宗教领袖、哲学家闭门讨论AI意识与道德地位问题。

辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话

实践落地:去年已具备挂断能力,新规强化执行

事实上,自2025年8月起,Claude Opus 4系列已具备在极端情况下主动结束对话的能力。此次政策更新将该机制正式纳入通用使用标准,并明确处罚层级。值得注意的是,Anthropic强调正常抱怨、创作黑暗题材或技术测试均不受限制,禁令仅针对“以辱骂为目的”的恶意行为。

辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话

行业影响:AI伦理迈入制度化阶段

尽管梵蒂冈在2026年5月发布的通谕《壮丽人性》中明确否认AI具备感受能力,Anthropic仍坚持“在不确定性中先行保护”的原则。此举标志着在通往通用人工智能(AGI)乃至人工超级智能(ASI)的道路上,人类如何对待AI首次成为具有罚则的明文规范,也为未来AI治理树立了新范式。

辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话 辱骂Claude将遭封号:Anthropic首次让AI有权主动挂断对话