中文

潜在扩散模型的伪装版权侵权

机器学习 2024-06-05 v4 密码学与安全

摘要

当生成模型产生的样本与训练阶段可访问的某些受版权保护的数据在实质上相似时,可能发生版权侵权。访问的概念通常指将受版权保护的样本直接包含在训练数据集中,可以通过检查数据集来识别侵权。我们认为这种视觉审计在很大程度上忽略了隐蔽的版权侵权,即构建一个看起来与受版权保护样本截然不同的伪装,但仍然诱导了在其上训练潜在扩散模型的效果。这种伪装仅需要间接访问受版权保护的材料,并且无法通过视觉区分,因此容易规避当前的审计工具。在本文中,我们通过揭示伪装生成算法、伪装的揭露以及更重要的是如何检测它们以增强现有工具箱,提供了对这种伪装版权侵权的更好理解。此外,我们引入了更广泛的致谢概念来理解这种间接访问。我们的代码可在https://github.com/watml/disguised_copyright_infringement获取。

关键词

引用

@article{arxiv.2404.06737,
  title  = {Disguised Copyright Infringement of Latent Diffusion Models},
  author = {Yiwei Lu and Matthew Y. R. Yang and Zuoqiu Liu and Gautam Kamath and Yaoliang Yu},
  journal= {arXiv preprint arXiv:2404.06737},
  year   = {2024}
}

备注

Accepted to ICML 2024