中文

通过原创性估计与通用化措施应对 AI 图像生成的版权问题

机器学习 2025-04-01 v7 人工智能 应用统计 统计方法学 机器学习

摘要

生成式 AI 技术的快速进展引发了显著的版权关注,导致大量诉讼针对 AI 开发者。值得注意的是,生成式 AI 能够生成受版权保护人物形象的能力已在文献中得到记录,而尽管已研究了 various techniques for 缓解版权问题,但仍存在显著风险。本文提出了一种通用化方法,通过修改生成模型的输出来使其更通用化,从而降低对受版权保护材料独特特征的模仿可能性。为实现这一目标,我们引入一种用于量化数据原创性水平的指标,通过从生成模型中抽取样本来估计,并应用于通用化过程中。作为实际实现,本文引入了 PREGen(Prompt Rewriting-Enhanced Genericization),该方法将我们的通用化方法与现有缓解技术结合。与现有方法相比,PREGen 在使用受版权保护人物名称作为提示词时,生成受版权保护人物的可能性降低了超过一半。此外,尽管生成模型即使在提示词中未直接提及人物名称也会产生受版权保护人物,PREGen 在这些情况下几乎完全阻止了此类人物的生成。最终,本研究推进了量化和加强版权保护的计算方法,从而为促进负责任的生成式 AI 开发提供了实用方法。

关键词

引用

@article{arxiv.2406.03341,
  title  = {Tackling Copyright Issues in AI Image Generation Through Originality Estimation and Genericization},
  author = {Hiroaki Chiba-Okabe and Weijie J. Su},
  journal= {arXiv preprint arXiv:2406.03341},
  year   = {2025}
}

备注

23 pages, 10 figures