
训练数据不够用,AI大厂开始下“毒手”
本文作者 | 哥吉拉
数据支持 | 勾股大数据(www.gogudata.com)

最近,一则消息在科技圈炸锅。
为OpenAI、Anthropic等头部AI实验室提供数据服务的数据工厂Mercor,正大规模寻找倒闭或被收购的初创企业,以高达30万美元的报价收购其内部数据集。
不仅包括代码库,更涵盖Slack聊天记录、Google Drive文档、电子邮件、Zoom会议录音等日常办公痕迹。
据数据公司Protege披露,今年以来其处理的数据交易总额已达至少1亿美元,而去年同期仅约3000万美元。
这又是一门因为AI而生的生意。
不过,这门生意背后,有令人发凉的地方。
01
无数据,不AI
AI的进化,本质上是“吃”数据的过程。
大语言模型的能力上限,在很大程度上取决于训练数据的质量、规模和多样性。
过去几年,AI产业享受了一场数据盛宴,互联网上公开可用的网页、书籍、论文、代码、百科、论坛帖子,几乎被各大实验室刮了个遍。
但盛宴终有散场之时。
数据公司Protege CEO鲍比·塞缪尔斯一语道破:“AI实验室已经基本刮完了整个互联网,现在需要的是人与人之间的真实互动。”
当AI从聊天机器人向数字员工演进时,对数据的需求发生了质变。
它不能只知道答案是什么,更需要知道人类到底是怎么完成工作的。
一份最终代码库像一道题的答案,能告诉模型产品最后怎样运行,却未必能解释问题最初从哪里冒出来、工程师为什么先排除一种可能、又为什么在测试失败后换了一条路。
而工单、聊天记录、会议转录和一次次代码修改,留下的正是这段中间过程,问题如何被发现、讨论、验证、修复的完整链路。
从技术角度看,这对应着训练数据从Type 2(人工设计任务)向Type 1(真实业务捕获)的范式转移。
代码领域已验证这一点。
大模型代码能力进步最快,重要原因之一是GitHub是全球最大的Type 1数据宝库,一条commit记录串起问题描述、修改方案、代码评审和测试结果,完整保留问题从出现到解决的全链路。
其他领域缺的不是需求,而是像GitHub这样现成的数据源。
这也就解释了一个逻辑闭环,AI要变得更智能,就必须不断训练,而更多、更深入的训练又需要更多数据,结果当公开资料被消耗殆尽,AI就必须向更深层、更私密的数据伸手。
如果没有更深入的资料,AI就会面临巧妇难为无米之炊的窘境,模型能力的天花板,也将被公开数据的天花板死死锁住,那还如何进化呢?
02
冲突爆发
当AI伸手索取这些深层数据时,问题随之而来。
Slack聊天记录里可能有客户信息,邮件里可能有员工姓名,会议里可能出现商业机密,医疗企业数据甚至涉及患者隐私。
AI实验室的刚需,与个人隐私权、企业商业秘密、劳动权益保护之间,形成了正面冲突。
这种冲突体现在多个维度,最核心的是隐私问题。
尽管Mercor等公司声称能识别并遮蔽60多类敏感标识符,但业内坦言彻底保护隐私几乎不可能。
更深的矛盾在于,工作记录最有价值的部分,往往不是一句话本身,而是谁在什么阶段说出,随后触发了什么动作。
姓名可替换,但岗位、时间、项目、客户关系和跨系统关联很难都删干净,数据清洗过度就会失去价值,保留这些关系又会带来重新识别和敏感信息泄露的风险。
其次是知情同意问题。
即使员工入职时签过知识产权协议,也不代表公司有权私自售卖内部聊天和工作记录,员工从未明确同意自己的工作对话被打包出售给AI公司用于训练。
还有商业机密、客户隐私风险、算法偏见等问题。
比如,真实工作数据,天然包含人类决策中的偏见和错误模式,当这些数据被用于训练AI智能体时,偏见会被规模化复制和放大。
法律监管也是一个棘手的问题。
全球范围内,对于企业内部工作数据能否被第三方收购用于AI训练这一问题,到现在都没有清晰的法律框架。
一些人会认为这是好事,因为监管宽松,可以推动AI能力快速发展,并可以产生一些新的业务和工作岗位,但它也打开了隐私泄露、伦理失范和法律真空的潘多拉魔盒。
当然了,监管是肯定要跟上的,不可能让AI继续裸奔,现在各方正在探索的解决路径包括:
法律层面尽快明确数据权属边界和“知情同意”标准;
技术层面发展联邦学习、差分隐私、合成数据等隐私保护技术;
行业层面建立数据溯源和自律标准;
企业层面在出售数据前充分告知员工并征得同意。
但可以预见的事,这场冲突的解决会是一个相当漫长的过程,各方的利益博弈是不会消失的。
03
巨头的原罪
其实,在讨论Mercor收购倒闭公司数据是否侵犯隐私之前,一些巨头的原罪也被再次拿出来讨论。
就拿谷歌和Meta来说,这两家全球最大的互联网平台,本身就沉淀了海量个人数据,包括数十亿用户的搜索记录、Gmail邮件、Google Docs文档、YouTube视频、Facebook帖子、Instagram照片、WhatsApp消息。
这些数据难道没有被用于AI训练吗?
真相是一直在用。
《纽约时报》就报道过,2023年7月4日美国独立日假期期间,谷歌发布了更新后的隐私政策,并且特意选择假期以分散公众注意力。
新政策明确写道:“我们使用公开可用的信息来帮助训练谷歌的AI模型。”
2023年,Meta也更新了隐私政策,明确声明用户在Facebook、Instagram上的公开帖子、照片、评论和Reels,都将被用于训练其AI模型。
2024年6月,Meta曾宣布暂停使用欧盟用户数据训练大语言模型,原因是爱尔兰数据保护委员会提出了数据保护方面的担忧。
但仅仅一年后,Meta又宣布恢复这一计划。
2026年2月,Meta正式确认将使用欧盟用户的公开数据训练AI模型,仅给予用户“反对”(opt-out)的权利,而非“同意”(opt-in)。
2026年6月,谷歌又悄悄更新了搜索隐私设置,自动将所有用户纳入其扩展的AI训练计划。
这些事实都说明,AI训练对个人隐私的侵犯,并不是从Mercor收购倒闭公司数据才开始的,从谷歌、Meta等巨头悄悄修改服务条款的那一刻起,就已经在发生了。
区别只是,巨头们用的是合法手段,而Mercor做的是灰色交易,法律边界更加模糊罢了。
04
尾声
Mercor的这门生意,撕开的恰恰是AI进化史中最荒诞的一页——我们一面惊叹于大模型的“智能”,一面又不得不承认,这种智能的底座,是无数打工人一辈子在工作生活中留下的、那些从未被好好安放的“数字遗产”。
事已至此,再去苛责Mercor的灰色交易,多少有些“解决提出问题的人”的意思。
谷歌、Meta的隐私政策静默更新,已经用行动表明了态度——哪怕没有Mercor,AI对深层数据的渴求也绝不会止步。
区别只在于,巨头们走的是堂而皇之的阳关道,Mercor们探的是若明若暗的独木桥。
这场冲突没有简单的善恶之分,只有不可避免的角力。
可以预见,未来的AI监管会为此划出新的红线,数据脱敏技术会走向更成熟的形态,甚至“数字遗产”的概念也会被重新定义。
但在那之前,我们或许只能接受这样一个尴尬的现实,AI的每一次进化,都在拿人类的数字隐私做燃料。
而这场“烧自己照亮AI”的赛跑,远未看到终点。(全文完)
格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。


