美国AI公司为训练模型毁书百万册,马斯克发声:必须不损坏书籍扫描

   发布时间:2026-08-11 15:49 作者:顾雨柔

美国人工智能企业Anthropic近期因一项名为“巴拿马计划”的行动引发全球关注。自2024年初以来,该公司斥资数千万美元,从全球二手书市场大规模收购纸质书籍,单次采购量从千册到百万册不等。其收购目标聚焦于冷门学术著作、绝版教材、地方史料、小语种文献及古籍等类别,尤其青睐2022年前出版的版本,理由是这些内容未受生成式AI污染,质量更具可靠性。

这一异常举动背后,折射出大语言模型训练的深层困境。尽管互联网数据量庞大,但低质量内容泛滥的问题日益严峻。随着生成式AI的普及,机器生成的文本充斥网络,导致可用训练数据质量断崖式下跌。若持续使用此类合成数据,模型将陷入“退化循环”——输出内容逐渐趋同,最终丧失逻辑连贯性。纸质书籍因其经过专业编辑审核、结构严谨、知识密度高的特性,被视为对抗模型退化的“最后堡垒”。

然而,Anthropic的处理方式引发巨大争议。据知情人士透露,该公司获取书籍后,直接使用液压切割机拆除书脊,通过高速扫描仪将书页转化为电子文档,随后立即销毁原始书籍。这一流程导致大量孤本、古籍永久消失,许多学术成果尚未完成数字化传播便化为纸浆。更令人担忧的是,该公司采取闭源策略,拒绝公开训练数据库,实质上构建起知识垄断壁垒。

这并非该公司首次陷入版权与伦理漩涡。2021年,其联合创始人被曝从网络非法下载超500万册盗版图书,次年再次实施类似行为,最终被法院裁定赔偿15亿美元。但针对当前毁书事件,联邦法官威廉·阿尔苏普却以“合理使用”原则为其开脱,认为破坏性扫描属于“变革性”技术需求。这种法律与道德的割裂,进一步激化了公众不满。

舆论压力下,部分科技巨头开始调整策略。马斯克近期宣布,要求旗下SpaceXAI公司采用无损扫描技术,并将处理后的数据存入公共图书馆。但这一表态被质疑为危机公关——此前该公司可能同样存在毁书行为,此次调整更像是应对舆论的权宜之计。截至目前,Anthropic及其他主要AI企业仍未就此作出实质性承诺,毁书行为是否仍在持续仍是个谜。

这场争议暴露出人工智能发展中的核心矛盾:技术进步与文化传承的冲突。当商业资本将知识视为可消耗的原材料,当法律框架滞后于技术伦理挑战,人类文明积累的智慧结晶正面临前所未有的危机。在资本逻辑主导的赛道上,如何守护文明的火种,已成为亟待解答的时代命题。

 
 
更多>同类内容
全站最新
热门内容