AI训练数据争夺战升级:买书销毁行为引发监管关注
美国联邦贸易委员会最近收到了一份不同寻常的请求。超过十家民间社会组织联合递交公开信,要求该机构对人工智能行业一种新兴的数据获取方式进行调查——部分大型AI公司正在通过购买、扫描并随后销毁实体书籍,来构建他们的训练数据集。
从数据获取到资源控制
根据《华盛顿邮报》披露的法庭文件,知名AI公司Anthropic曾花费数百万美元购买书籍,拆除书脊进行批量扫描,这些数据最终用于训练其Claude模型。类似的做法也出现在针对Google、微软和OpenAI的版权诉讼中。
然而,民间组织的关注点超越了版权范畴。他们向FTC提出的核心质疑是:这种“获取即销毁”的模式,是否已经演变为一种不公平的竞争手段?
双重风险:文化流失与市场垄断
公开信指出了两个相互关联的深层问题:
- 文化资源的不可逆损失:当AI公司扫描并销毁实体书籍,特别是稀有或绝版书籍时,他们可能在无意中成为“最后拥有者”。数字化副本固然存在,但实体版本的永久消失意味着文化遗产的某种终结。
- 数据壁垒的悄然筑起:更隐蔽的风险在于市场竞争结构。通过控制并“消耗”关键数据源,头部企业可能:
- 大幅提高后来者获取相同质量数据的成本
- 切断初创公司训练模型所需的核心原材料
- 将数据优势转化为难以逾越的系统性护城河
监管的微妙平衡
值得注意的是,这些组织并没有要求FTC限制AI模型训练本身。他们的诉求更加精准:希望监管机构审查“销毁现有作品”这一具体行为,并在大型科技公司借此建立稳固市场优势之前,采取相应的干预措施。
公开信将这种行为描述为“可能掏空市场的关键数据资源”,并警告它正在成为构筑垄断地位的“另一种结构性手段”。
目前,FTC正处于微妙的监管十字路口。一方面,委员会在特朗普政府时期倾向于维持对企业相对友好的监管环境;另一方面,对科技巨头可能存在的反竞争行为和市场垄断风险,监管机构始终保持着警觉。这封公开信无疑为已经复杂的AI监管讨论增添了新的维度——当数据争夺开始以实体文化资源的消失为代价时,监管的边界和重心可能需要重新审视。