通过自适应注意力调制缓解扩散模型中的幻觉
计算机视觉与模式识别
2025-02-25 v1
摘要
扩散模型虽然在生成逼真图像方面日益精进,但明显受到幻觉的阻碍——即与训练数据分布不一致的不真实或错误特征。在这项工作中,我们提出了一种自适应注意力调制(AAM)方法,通过分析和调制扩散模型中的自注意力机制来缓解幻觉。我们假设,在早期去噪步骤中的自注意力可能会无意中放大或抑制特征,从而导致幻觉。为了应对这一问题,AAM 在自注意力层的 softmax 操作中引入了温度缩放机制,在推理过程中动态调制注意力分布。此外,AAM 采用掩码扰动技术来破坏早期阶段的噪声,否则这些噪声可能会在后期阶段传播为幻觉。大量实验表明,AAM 能有效减少幻觉伪影,提高生成图像的保真度和可靠性。例如,所提方法在 Hands 数据集上将 FID 分数提高了 20.8%,并将幻觉图像的百分比(绝对值)减少了 12.9%。
引用
@article{arxiv.2502.16872,
title = {Mitigating Hallucinations in Diffusion Models through Adaptive Attention Modulation},
author = {Trevine Oorloff and Yaser Yacoob and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2502.16872},
year = {2025}
}