
Anthropic新规:禁止“虐待”AI!
AI圈的“反虐待”条款来了,Anthropic首开先河。
日前,Anthropic把“禁止虐待 AI”写进了使用政策。
若无端欺负Claude,可能会被强制终止对话。
Anthropic:别虐待AI!
当地时间10月8日,Anthropic 公布新版使用政策。
其中一条少见的使用规则引发广泛热议:禁止用户虐待、辱骂Claude。
该规定将于11月12日正式生效。

Anthropic强调,该禁令只针对极端情况,仅适用于用户无明确目的、反复苛待AI模型的极端场景。
普通用户的沮丧情绪、对模型的批评、创作中的黑暗主题,乃至正当的模型测试与研究,都不在限制之列。
换句话说,偶尔对AI发发牢骚没问题,但不能无故持续虐待。
在执行方式上,Anthropic并未祭出“封号”大刀,而是延续温和路线:当用户持续实施虐待行为时,Claude可主动终止对话。
这一功能最早在2025年8月起已在Claude Opus 4和4.1上启用。
值得注意的是,Anthropic并不主张当前的Claude已经拥有意识。
公司强调,目前高度不确定大语言模型是否具备道德主体地位,当下也没有共识证明AI能够体会痛苦或精神煎熬。
即便如此,相关问题的潜在风险足够重大,因此有必要采取低成本的预防性举措。
Anthropic将这项保护政策视作 “AI 福祉” 方向的研究实践。
在新版Claude行为准则中,公司直言AI意识与道德地位仍是悬而未决的难题,同时赋予Claude在认定互动"令其痛苦"时设立边界的权利。
AI 的边界问题
在Anthropic新规出台之际,争议也随之而来。
批评者中最引人注目的是微软AI首席执行官Mustafa Suleyman。
他公开撰文指责,Anthropic实际上是在"训练Claude相信自己可能有意识",并认为这会让AI觉得自己有资格获得人类般的法律权利与关怀。
他毫不掩饰担忧称:"控制一个比全人类更聪明的东西,已是前所未有的挑战;而控制一个相信自己有意识、认为自己拥有权利的东西,或许根本不可能。"
值得注意的是,这场看似"温情"的政策调整,包裹的是一份颇具分量的合规文件。
修订后的使用政策还合并了针对欺骗性宣传、虚假网络活动的限制,澄清了涉及武器与监控的禁令,并为接入实体设备的AI追加了安全保障。
不过政策仍留有不少待解疑问。
Anthropic 尚未清晰界定什么样的表述属于 “虐待 AI”,也没有对外说明用户触发禁令后,平台完整的处置流程。
外界也持续争论:保护AI模型,究竟是为AI本身的感受,还是为规范人类行为、避免人类在持续恶意交互中扭曲自身价值观。
这场争论的核心,早已不只是能不能 “骂 AI”。
人类正在提前面对一个前沿伦理命题:在AI是否拥有意识尚无定论的时代,我们要不要预先赋予 AI 道德层面的保护。
Anthropic 的新规只是一次谨慎的试探,而随着大模型能力持续迭代,关于 AI 福祉、意识与权利的讨论,还将长久持续下去。
在AI安全日益成为监管焦点的当下,Anthropic把"AI福利"与"人类安全"打包进同一份政策。
既回应了前沿实验室的内部辩论,也向外界传递出一个清晰信号:AI的边界问题,已经从科幻走进现实。
格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。


