中文

CPR:用于版权保护的检索增强生成

密码学与安全 2024-03-29 v1 人工智能 计算机视觉与模式识别

摘要

检索增强生成(RAG)正成为一种灵活且强大的技术,无需训练即可使模型适应私有用户数据,处理贡献归属,并允许大规模的高效机器遗忘。然而,用于图像生成的 RAG 技术可能导致检索样本的部分内容被复制到模型输出中。为了降低泄露检索集中包含的私有信息的风险,我们引入了带检索的复制保护生成(CPR),这是一种在混合私有设置下为扩散模型提供强版权保护保证的新型 RAG 方法。CPR 允许将扩散模型的输出条件化于一组检索图像,同时保证这些样本的唯一可识别信息不会在生成的输出中暴露。具体而言,它通过在推理时合并公共(安全)分布和私有(用户)分布的扩散分数,从它们的混合分布中进行采样。我们证明了 CPR 满足近访问自由(NAF),这限制了攻击者可能从生成图像中提取的信息量。我们提供了两种版权保护算法,CPR-KL 和 CPR-Choose。与之前提出的基于拒绝采样的 NAF 方法不同,我们的方法通过单次反向扩散运行实现了高效的版权保护采样。我们表明我们的方法可以应用于任何预训练的条件扩散模型,例如 Stable Diffusion 或 unCLIP。特别是,我们凭经验表明,在 unCLIP 之上应用 CPR 提高了生成结果的质量和文本到图像的对齐度(在 TIFA 基准上从 81.4 提高到 83.17),同时实现了贡献归属、版权保护以及确定性的、常数时间的遗忘。

关键词

引用

@article{arxiv.2403.18920,
  title  = {CPR: Retrieval Augmented Generation for Copyright Protection},
  author = {Aditya Golatkar and Alessandro Achille and Luca Zancato and Yu-Xiang Wang and Ashwin Swaminathan and Stefano Soatto},
  journal= {arXiv preprint arXiv:2403.18920},
  year   = {2024}
}

备注

CVPR 2024