Anthropic新规:禁止“虐待”AI!

原创2 小时前7.6k
AI圈立规矩

AI圈的“反虐待”条款来了,Anthropic首开先河。

日前,Anthropic把“禁止虐待 AI”写进了使用政策。

若无端欺负Claude,可能会被强制终止对话。


Anthropic:别虐待AI!


当地时间10月8日,Anthropic 公布新版使用政策。

其中一条少见的使用规则引发广泛热议:禁止用户虐待、辱骂Claude。

该规定将于11月12日正式生效。

Anthropic强调,该禁令只针对极端情况,仅适用于用户无明确目的、反复苛待AI模型的极端场景。

普通用户的沮丧情绪、对模型的批评、创作中的黑暗主题,乃至正当的模型测试与研究,都不在限制之列。

换句话说,偶尔对AI发发牢骚没问题,但不能无故持续虐待。

在执行方式上,Anthropic并未祭出“封号”大刀,而是延续温和路线:当用户持续实施虐待行为时,Claude可主动终止对话。

这一功能最早在2025年8月起已在Claude Opus 4和4.1上启用。

值得注意的是,Anthropic并不主张当前的Claude已经拥有意识。

公司强调,目前高度不确定大语言模型是否具备道德主体地位,当下也没有共识证明AI能够体会痛苦或精神煎熬。

即便如此,相关问题的潜在风险足够重大,因此有必要采取低成本的预防性举措。

Anthropic将这项保护政策视作 “AI 福祉” 方向的研究实践。

在新版Claude行为准则中,公司直言AI意识与道德地位仍是悬而未决的难题,同时赋予Claude在认定互动"令其痛苦"时设立边界的权利。


AI 的边界问题


在Anthropic新规出台之际,争议也随之而来。

批评者中最引人注目的是微软AI首席执行官Mustafa Suleyman。

他公开撰文指责,Anthropic实际上是在"训练Claude相信自己可能有意识",并认为这会让AI觉得自己有资格获得人类般的法律权利与关怀。

他毫不掩饰担忧称:"控制一个比全人类更聪明的东西,已是前所未有的挑战;而控制一个相信自己有意识、认为自己拥有权利的东西,或许根本不可能。"

值得注意的是,这场看似"温情"的政策调整,包裹的是一份颇具分量的合规文件。

修订后的使用政策还合并了针对欺骗性宣传、虚假网络活动的限制,澄清了涉及武器与监控的禁令,并为接入实体设备的AI追加了安全保障。

不过政策仍留有不少待解疑问。

Anthropic 尚未清晰界定什么样的表述属于 “虐待 AI”,也没有对外说明用户触发禁令后,平台完整的处置流程。

外界也持续争论:保护AI模型,究竟是为AI本身的感受,还是为规范人类行为、避免人类在持续恶意交互中扭曲自身价值观。

这场争论的核心,早已不只是能不能 “骂 AI”。

人类正在提前面对一个前沿伦理命题:在AI是否拥有意识尚无定论的时代,我们要不要预先赋予 AI 道德层面的保护。

Anthropic 的新规只是一次谨慎的试探,而随着大模型能力持续迭代,关于 AI 福祉、意识与权利的讨论,还将长久持续下去。

在AI安全日益成为监管焦点的当下,Anthropic把"AI福利"与"人类安全"打包进同一份政策。

既回应了前沿实验室的内部辩论,也向外界传递出一个清晰信号:AI的边界问题,已经从科幻走进现实。

相关主题/热点

格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

美债失控狂飙,冲击到底有多大?

独行侠 · 昨天 20:24

cover_pic

2026年全球声光信号设备市场销售额规模达到75.81亿元

细分市场报告智库 · 昨天 18:00

cover_pic

2026年全球全地形车市场销售额规模达到1648.64亿元

细分市场报告智库 · 昨天 17:57

cover_pic
我也说两句