AI 预训练数据过滤中的版权问题:监管格局与缓解策略
计算机与社会
2026-01-21 v2 密码学与安全
摘要
通用人工智能模型的快速发展加剧了关于训练数据侵犯版权的担忧,但当前的监管框架仍主要具有反应性而非主动性。本文审视了欧盟、美国和亚太地区等主要司法辖区中AI训练数据治理的监管格局,并识别出威胁创作者权利及AI发展可持续性的执法机制中的关键缺口。通过分析重大案例,我们识别了预训练数据过滤中的关键缺口。透明度工具、感知散列和访问控制机制等现有解决方案仅能解决问题的特定方面,无法防止初始版权侵权。我们确定了两个根本性挑战:预训练许可收集与内容过滤——这面临在规模上实现全面版权管理的不可能性;以及验证机制——缺乏确认过滤是否防止了侵权的工具。我们提出一种多层次过滤管道,结合访问控制、内容验证、机器学习分类器和持续的数据库交叉引用,以将版权保护从训练后检测转向训练前预防。该方法为保护创作者权利同时支持AI持续创新提供了一条路径。
引用
@article{arxiv.2512.02047,
title = {Copyright in AI Pre-Training Data Filtering: Regulatory Landscape and Mitigation Strategies},
author = {Mariia Kyrychenko and Mykyta Mudryi and Markiyan Chaklosh},
journal= {arXiv preprint arXiv:2512.02047},
year = {2026}
}