15亿美元和解案:Anthropic的‘蒸馏’双重标准

一边控诉别人抄袭自己的模型,一边掏出 15 亿美元收购他人著作来训练自己的模型。Anthropic 把“蒸馏”一词,玩成了两副截然不同的面孔。
7 月 20 日,美国联邦法官为 Anthropic 与一群作家之间的版权纠纷画上了句号:和解金 15 亿美元。这是目前已知的 AI 版权诉讼中数额最高的一次。作家们声称,Anthropic 在未获授权的情况下,将他们的书籍用来训练 Claude 模型。而仅仅数月之前,Anthropic 还曾公开指责中国 AI 公司“蒸馏”其模型。
15 亿美元换来了什么
这起案件名为 Bartz v. Anthropic。一群作家将 Anthropic 告上法庭,理由是自己的书被拿去喂养 Claude,既没有授权,也没有补偿。
Anthropic 并未承认存在不当行为,但同意支付 15 亿美元来了结纠纷。路透社称之为“已知同类案件中金额最大的和解”。美联社的标题更加直接:法官批准 Anthropic 支付 15 亿美元,就使用盗版书籍训练 Claude 一案达成和解。
15 亿美元是什么体量?Anthropic 2024 年全年营收大约 20 亿美元,这笔和解金几乎吃掉了大半年的收入。对一家仍处于烧钱阶段的 AI 公司来说,这绝不是一个轻松的负担。
需要留意的是,和解并不等同于认罪。Anthropic 在协议中并未认可侵犯版权。但 15 亿美元这个数字足以说明,将诉讼继续下去的潜在风险,已经大到不值得再赌下去。
“蒸馏”的两张脸
让这条新闻在社交平台上炸锅的,不光是金额本身。还有 zerohedge 那句评语:“Anthropic 一面指控中国蒸馏它的模型,一面刚花 15 亿美元蒸馏书籍。”
这条推文获得了超过 36 万次浏览和 7300 多个点赞。它精准地戳到了许多人早已察觉的不对劲。
先厘清“蒸馏”在 AI 中的含义。简单来说,就是利用大模型的输出,去训练一个小模型。小模型据此习得了大模型的能力,但并不需要从头训练,省时、省钱、省算力。
Anthropic 曾多次公开指责中国 AI 公司借助蒸馏技术窃取 Claude 的能力,并将这一行为定性为知识产权侵犯。
用别人的著作训练自己的模型,叫做“学习”;而用别人的模型训练自己的模型,却被称作“偷窃”。同一个动作,两套标准。
当然,严格而言,用书籍训练模型和用模型输出训练模型,在法律上并非完全等同。前者环绕的是版权法中的“合理使用”争议,而后者涉及的是服务条款与模型许可协议。但 zerohedge 的讽刺,确实揭露出一个结构性矛盾——AI 公司对自身的权利极度敏感,却在利用他人创作时,将边界推到了极致。
不只是 Anthropic 的困境
Anthropic 并非第一家因训练数据而惹上官司的 AI 公司。OpenAI、Meta、Stability AI 都曾面临类似的版权诉讼。然而,15 亿美元的和解金额,将这一事件推向了全新的量级。
过去几年里,AI 行业的默认模式是:先拿来用再说。互联网上能抓到的文本、图片、书籍、代码,统统被塞进训练集。至于版权?那是以后才需要操心的事情。
15 亿美元的和解金意味着,“以后”已经到来。它为整个行业锚定了一个价格准星——使用创作者的内容训练模型,代价可能就是数十亿级别。
补充一句:OpenAI 与《纽约时报》的版权诉讼仍在拉锯。Meta 和 Stability AI 也面临着多起集体诉讼。Anthropic 的和解,很可能加速其他案件的谈判进程。
创作者的账,迟早要清算
对普通创作者而言,这一和解传递出一个明确的信号:你写的书、你发的文章、你敲下的代码,若被拿去训练 AI 模型,并非没有追索权。
不过,15 亿美元分配到每一位原告作家手里后,数字或许并没有想象中那般震撼。集体诉讼的特点正是总额庞大,人均有限。真正带来的改变,是迫使 AI 公司重新审视训练数据的获取方式。
事实上,已有 AI 公司开始转向授权模式——与出版商签订数据许可协议,为训练内容付费。Anthropic 自身也在推进与部分出版商的合作。15 亿美元的和解金,可能让这条路径的谈判节奏大幅加快。
zerohedge 的那条推文没有写完最后一句话,但所有人都读懂了。如果“蒸馏”别人的模型算偷窃,那么“蒸馏”别人的书,又该称作什么?那份 15 亿美元的和解协议,正是 Anthropic 亲手写下的答案。