SEED:通过自我演化蒸馏消除 LVLMs 中的幻觉
机器学习
2025-08-20 v2 人工智能
计算机视觉与模式识别
摘要
大型视觉语言模型(LVLMs)在诸多领域取得了显著进展,但幻觉问题显著限制了其可信度和应用潜力。现有消除幻觉的方法通常依赖外部工具或多轮推理比较,显著增加推理时间。本文提出了自我演化蒸馏(SEED),通过识别 LVLMs 内部知识中的幻觉、隔离并清除它们,然后将净化后的知识蒸馏回模型中实现自我演化。此外,我们发现传统蒸馈方法容易在 LVLMs 的输出空间中引入空洞。为解决此问题,我们提出了一种模式寻求演化方法,该方法进行蒸馈以捕获净化知识分布的主导模式,从而避免因空洞空间而产生的混乱结果。我们还引入了幻觉消除适配器,通过学习净化知识来纠正原始模型的暗知识。广泛的实验表明,SEED 在多个基准测试中表现出色,显著提升了代表性 LVLMs 如 LLaVA-1.5 和 InternVL2 的幻觉消除效果。值得注意的是,LLaVA-1.5 在幻觉评估指标 POPE-Random 上的 F1 分数从 81.3 提升到 88.3。
引用
@article{arxiv.2507.04680,
title = {Identify, Isolate, and Purge: Mitigating Hallucinations in LVLMs via Self-Evolving Distillation},
author = {Wenhao Li and Xiu Su and Jingyi Wu and Feng Yang and Yang Liu and Yi Chen and Shan You and Chang Xu},
journal= {arXiv preprint arXiv:2507.04680},
year = {2025}
}
备注
In Figure 2, the correlation coefficient and the scatter plot do not match. I calculated this correlation using two sets of settings. I used the scatter plot from setting A, but accidentally wrote the correlation coefficient, r, from setting B