局部内在维度揭示扩散模型中的幻觉
计算机视觉与模式识别
2026-05-07 v1 人工智能
摘要
扩散模型容易生成结构性幻觉——这些样本符合训练数据的统计特性,却违背底层结构规则,导致如手指多于五指等异常现象。最近的研究从多个视角探讨了这一失效模式,提供了部分解释,如模式插值。本文提出一种互补视角,将幻觉视为模型诱导流形上的不稳定性。我们首先表明,基于此类不稳定性的幻觉滤波器在性能上与最近提出的时序方法相当。通过追踪这些不稳定性的来源,我们识别出局部内在维度(LID)是其主要驱动因素,并提出一种直接的纠正机制——Intrinsic Quenching(IQ),通过压制 LID 来缓解幻觉。IQ 在广泛的基准测试中一致优于标准的幻觉减少基准,为在下游医学影像任务中强制解剖一致性提供了高度有前景的解决方案。
引用
@article{arxiv.2605.05026,
title = {Local Intrinsic Dimension Unveils Hallucinations in Diffusion Models},
author = {Bartlomiej Sobieski and Matthew Tivnan and Dawid Płudowski and Michał Jan Włodarczyk and Pengfei Jin and Przemyslaw Biecek and Quanzheng Li},
journal= {arXiv preprint arXiv:2605.05026},
year = {2026}
}
备注
Preprint