中文

Intervene-All-Paths:统一缓解 LVLM 幻觉的干预框架

计算机视觉与模式识别 2026-01-07 v2 人工智能

摘要

尽管大型视觉语言模型 (LVLMs) 在广泛的任务中表现出色,但仍容易产生幻觉。在本研究中,我们提出了一套全面的干预框架,与 LVLMs 的因果架构相吻合,整合了不同干预路径对幻觉的影响。我们发现,LVLMs的幻觉并非源自单一的因果路径,而是来自图像到输入文本、图像到输出文本以及文本到文本路径之间的相互作用。首次我们还发现,LVLMs在不同的问题-答案对齐格式下依赖不同的路径。基于这些见解,我们提出了简单且有效的方法,用于识别和干预每个路径中的关键幻觉头部,针对判别式和生成式格式进行调整。实验在多个基准测试上表明,我们的方法在 diverse alignment types 下一致有效减少幻觉。

关键词

引用

@article{arxiv.2511.17254,
  title  = {Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats},
  author = {Jiaye Qian and Ge Zheng and Yuchen Zhu and Sibei Yang},
  journal= {arXiv preprint arXiv:2511.17254},
  year   = {2026}
}

备注

Accepted to NeurIPS 2025, Project Page: https://github.com/SooLab/AllPath