为训练AI模型,Anthropic耗资数百万美元购入并“销毁”巨量图书
创始人
2025-06-26 13:41:41
0

6 月 26 日消息,据外媒 Ars Technica 今日报道,当地时间周一公开的法庭文件披露,人工智能公司 Anthropic 曾斥资数百万美元,将实体图书拆解并扫描成数字文件,用于训练类似 ChatGPT 的 AI 助手 Claude。为了获取训练数据,公司将大量图书拆除装订、扫描进系统,随后直接丢弃原件。

判决书长达 32 页,披露了 Anthropic 在 2024 年 2 月雇佣 Tom Turvey 的经过。Turvey 曾负责 Google Books 项目的合作事务,公司委托他“获取全世界的图书”。这一战略性人事安排,显然是希望复制谷歌曾被法院认定为合理使用的图书数字化模式。

最终,法官 William Alsup 裁定,该扫描方式构成合理使用,理由是图书已由 Anthropic 合法购买、扫描后即刻销毁,且数字文件仅限内部使用,未向外传播。他认为这类转换相当于“节省空间”的数字化转化,具有合理使用中的“转化性”特征。如果公司一开始就遵守这一路径,或许已树立 AI 合理使用的首个判例,但早期的盗版行为削弱了其合法性。

核心原因其实很简单:AI 训练需要海量优质文本。为了构建大语言模型,研究人员需将亿万词语输入神经网络,反复训练模型,建立词语与概念之间的关系。

训练数据的质量直接影响模型输出的准确性。相比网络评论等杂乱信息,编辑过的书籍和文章能显著提升 AI 的语言能力。

AI 公司急需出版内容,但通常不愿耗费时间谈授权。美国的“首次销售原则”提供了法律空间:买下实体书之后,使用者可以自行处理。这就让购买图书成为一种合法的“绕道方案”。

和许多同行一样,Anthropic 最初选择了绕过版权的捷径。IT之家从法庭材料获悉,为了绕开冗长复杂的授权流程,CEO 阿莫代伊曾主张使用盗版电子书。但到了 2024 年,出于法律考虑,公司开始寻求更安全的替代方案。

收购二手书成为理想选择:不必谈授权,又能获得质量上乘的训练文本。为了加快数字化进程,Anthropic 采用“破坏式扫描”,大量购入图书,拆封、裁剪、整批扫描为机器可读的 PDF 文件,完成后纸本全部废弃。整个流程耗资数百万美元。

该公司的购买对象大多是零售渠道的普通旧书。但事实上,非破坏性扫描技术早已成熟。比如 Internet Archive 就开发出可保留原书的数字化手段。本月早些时候,OpenAI 和微软也宣布与哈佛大学图书馆合作,计划使用近百万本公版书籍训练 AI,这些书籍在被数字化的同时依旧妥善保存。

【来源:IT之家】

相关内容

热门资讯

三三智能取得多通道提升供料单机... 金融界2025年6月26日消息,国家知识产权局信息显示,广东三三智能科技有限公司取得一项名为“一种多...
新洲税务:“云帮办”快速响应诉... 新洲税务:“云帮办”快速响应诉求解难题 武汉市新洲区税务局以征纳互动为载体,持续强化科技赋能,积极...
充电宝无3C标识或被召回型号禁... 连日来,充电宝安全事件引发广泛关注。6月26日,民航局发布紧急通知:为切实保障航空运行安全,自6月2...
直击GISTC 2025专题会... (转自:超图软件集团) 在6月24日举办的2025空间智能软件技术大会主题大会上,从院士专家、政府部...
海尔集团收购新时达完成股权交割... 2025年6月26日,海尔集团宣布成功完成战略入股上海新时达电气股份有限公司(“上海新时达”)的协议...
首航成功!无人机开辟应急医疗器... 中新网上海6月26日电 (记者 陈静)26日,一架搭载胸腰椎工具包的无人机,精准飞抵复旦大学附属肿瘤...
自觉担起科技自立自强使命 作为全国举足轻重的科教大省,湖北以高度的战略自觉,肩负起推动科技自立自强、建设科技强国的战略责任,为...
向明智控机器人项目厂房主体结构... 6月25日从山西转型综改示范区获悉,入区企业太原向明智控科技有限公司采煤工作面机器人集群无人化控制系...
Meta Platforms成... 6月26日消息,据华尔街日报报道,全球科技巨头Meta Platforms(NASDAQ:META)...
总投资10亿!高端芯片封装项目... 6月20日,咸宁高新区举行“高端滤波器芯片先进封装项目”签约仪式,标志着这一总投资10亿元的高科技项...
对话美团高级副总裁李树斌:“必... 出品|搜狐科技 作者|汉雨棣 编辑|杨锦 6月25日,2025大众点评“必吃榜”(以下简称:“必吃榜...
曝高通仍在测试三星工艺骁龙 8... 6 月 26 日消息,韩媒 Business Post 当地时间昨日报道称,高通仍在测试基于三星晶圆...
四川探索戒毒新路 托起吸毒人员... 中新网成都6月26日电 (单鹏 安源)在戒毒治疗室,戒毒人员小张(化名)戴上AR眼镜,身上贴着传感器...
华如科技:自2025年起专注于... 证券之星消息,华如科技(301302)06月25日在投资者关系平台上答复投资者关心的问题。 投资者:...
AI健康服务体验再升级!京东健... “你还别说,这个大为医生还真靠谱,回答问题特别细致,特别专业,以后小毛病就可以先问他了!”“营养师小...
渤海阀门取得电动对夹蝶阀专利,... 金融界2025年6月26日消息,国家知识产权局信息显示,渤海阀门集团有限公司取得一项名为“一种电动对...
奥尔特曼称ChatGPT功能远... #奥尔特曼称ChatGPT不止是谷歌替代品#【OpenAI 奥尔特曼:ChatGPT 的功能已经远不...
AI时代,CEO要学会「翻垃圾... AI时代,CEO要学会「翻垃圾桶」 Chatgpt横空出世后,有CEO说:AI来临,我自以为牢固的根...
市值重回全球第一 “AI芯片霸... 封面新闻记者 朱宁 周三(6月25日),英伟达涨4.3%,创下历史新高,收盘市值达3.77万亿美元,...
浙江超伟机械取得袋底折叠装置专... 金融界2025年6月26日消息,国家知识产权局信息显示,浙江超伟机械有限公司取得一项名为“一种袋底折...