扩散归因得分:评估扩散模型中训练数据影响
机器学习
2025-03-24 v4 人工智能
摘要
随着扩散模型的流行增加,版权和私人图像的滥用已成为主要关切。一个有前景的解决方案是识别生成模型中特定训练样本的贡献,这一过程称为数据归因。扩散模型的现有数据归因方法通常通过评估样本包含或排除于训练过程时的扩散损失变化来量化训练样本的贡献。然而,我们认为,直接使用扩散损失无法准确表示此类贡献,因为扩散损失的计算方式。具体而言,这些方法测量预测分布与真实分布之间的偏差,这导致对预测分布之间进行间接比较,无法表示模型行为之间的差异。为了解决这些问题,我们旨在通过归因得分(Diffusion Attribution Score, DAS)进行预测分布之间的直接比较,以分析训练样本的重要性,这是在理论分析的支持下阐明了DAS的有效性。此外,我们探索了加速DAS计算策略,以促进其在大规模扩散模型上的应用。我们的广泛实验跨越各种数据集和扩散模型,证明DAS在线性数据建模得分方面显著优于以往基准,建立了新的最先进性能。代码可在 \hyperlink{here}{https://github.com/Jinxu-Lin/DAS} 获取。
引用
@article{arxiv.2410.18639,
title = {Diffusion Attribution Score: Evaluating Training Data Influence in Diffusion Models},
author = {Jinxu Lin and Linwei Tao and Minjing Dong and Chang Xu},
journal= {arXiv preprint arXiv:2410.18639},
year = {2025}
}