并非每张图像都值一千词:量化Stable Diffusion中的原创性
计算机视觉与模式识别
2024-08-16 v1 机器学习
摘要
本文研究文本到图像(T2I)生成扩散模型中原创性的量化问题,重点关注版权原创性。我们首先通过受控实验评估T2I模型的创新与泛化能力,结果表明Stable Diffusion模型在训练数据足够多样的情况下能够有效重现未见元素。然后,我们的关键洞察是:模型熟悉的概念和图像元素组合在训练中见过更多,因此在模型的潜在空间中被更简洁地表示。基于此,我们提出一种利用文本反转来衡量图像原创性的方法,依据模型重建该图像所需的token数量。该方法受法律原创性定义的启发,旨在评估模型是否能在不依赖特定提示或训练数据的情况下生成原创内容。我们在预训练的Stable Diffusion模型和合成数据集上验证了该方法,展示了token数量与图像原创性之间的相关性。本工作有助于理解生成模型中的原创性,并对版权侵权案件具有启示意义。
引用
@article{arxiv.2408.08184,
title = {Not Every Image is Worth a Thousand Words: Quantifying Originality in Stable Diffusion},
author = {Adi Haviv and Shahar Sarfaty and Uri Hacohen and Niva Elkin-Koren and Roi Livni and Amit H Bermano},
journal= {arXiv preprint arXiv:2408.08184},
year = {2024}
}
备注
GenLaw ICML 2024