通过模态插值理解扩散模型中的幻觉
机器学习
2024-08-27 v2
摘要
通俗地说,基于扩散过程的图像生成模型常被指出现“幻觉”,即生成训练数据中从未出现过的样本。但这些幻觉从何而来?在本文中,我们研究了扩散模型中的一种特定失效模式,我们称之为模态插值。具体来说,我们发现扩散模型平滑地“插值”训练集中邻近的数据模态,生成完全超出原始训练分布支撑集的样本;这种现象导致扩散模型生成真实数据中从未存在的伪影(即幻觉)。我们系统地研究了这一现象的原因和表现。通过在一维和二维高斯分布上的实验,我们展示了扩散模型解码器中不连续的损失景观如何导致任何平滑近似都会引起此类幻觉的区域。通过在具有各种形状的人工数据集上的实验,我们展示了幻觉如何导致从未存在过的形状组合的生成。最后,我们表明扩散模型实际上知道它们何时超出支撑集并产生幻觉。这体现在生成样本在最后几步反向采样过程中轨迹的高方差上。通过使用一个简单的度量来捕捉这种方差,我们可以在生成时移除超过95%的幻觉,同时保留96%的支撑集内样本。我们通过展示这种幻觉(及其移除)对合成数据递归训练崩溃(和稳定)的影响来结束我们的探索,并在MNIST和二维高斯数据集上进行了实验。我们在https://github.com/locuslab/diffusion-model-hallucination发布了我们的代码。
引用
@article{arxiv.2406.09358,
title = {Understanding Hallucinations in Diffusion Models through Mode Interpolation},
author = {Sumukh K Aithal and Pratyush Maini and Zachary C. Lipton and J. Zico Kolter},
journal= {arXiv preprint arXiv:2406.09358},
year = {2024}
}
备注
Additional results on real datasets