中文

AFTER:通过自适应事实导向激活编辑缓解 LVLM 对象幻觉

计算机视觉与模式识别 2026-03-12 v1

摘要

大型视觉语言模型(LVLMs)在跨模态任务中取得了显著进展。然而,由于语言偏见,LVLMs 容易产生对象幻觉,这类幻觉主要分为类别、属性和关系幻觉,显著阻碍了可信赖的人工智能应用。对 LVLM 内部激活进行编辑在以最小成本缓解幻觉方面显示出前景的效果。然而,之前的编辑方法忽略了来自事实文本语义所提供的有效指导,因而难以明确缓解语言偏见。为此,本文提出了一种用于幻觉缓解的自适应事实引导视觉-文本编辑框架(AFTER),其包含事实增强激活引导(FAS)和查询自适应偏移优化(QAO),以自适应地将原始偏置激活引导 toward 事实语义。具体而言,FAS 提供事实和通用的激活编辑指导,从而显式地建模精确的视觉-文本关联。随后,QAO 引入查询感知偏移估计算子,以建立查询特定的编辑,从而增强编辑的多样性和细粒度。对三个广泛采用的 LVLMs 上的标准幻觉基准进行大量实验表明,所提出的 AFTER 方法有效,尤其在 AMBER 基准上可实现约16.3%的幻觉降低。我们将发布代码和数据以便重复验证。

关键词

引用

@article{arxiv.2601.01957,
  title  = {AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing},
  author = {Tianbo Wang and Yuqing Ma and Kewei Liao and Zhange Zhang and Simin Li and Jinyang Guo and Xianglong Liu},
  journal= {arXiv preprint arXiv:2601.01957},
  year   = {2026}
}