中文

扩散模型的训练数据归因

机器学习 2023-06-06 v1 人工智能 机器学习

摘要

扩散模型因基于训练数据集合成高质量样本而日益流行。然而,鉴于训练数据集往往规模巨大,难以评估训练数据如何影响训练好的扩散模型所产生的样本。扩散模型输入与输出之间关联的困难给模型可解释性与训练数据归因带来了重大挑战。在此我们提出一种新颖解决方案,通过集成方法揭示训练数据如何影响扩散模型的输出。在我们的方法中,编码集成中的各个模型在精心设计的整体训练数据划分上训练,以识别有影响的训练样本。所得的模型集成实现了训练数据影响的高效消融,使我们能够评估训练数据对模型输出的影响。我们展示了这些集成作为生成模型的可行性以及我们归因方法的有效性。

关键词

引用

@article{arxiv.2306.02174,
  title  = {Training Data Attribution for Diffusion Models},
  author = {Zheng Dai and David K Gifford},
  journal= {arXiv preprint arXiv:2306.02174},
  year   = {2023}
}

备注

14 pages, 6 figures