中文

通过关系感知视觉增强缓解 LVLMs 中的动作-关系幻觉

计算机视觉与模式识别 2026-05-13 v1

摘要

大型视觉语言模型 (LVLMs) 在多样化的视觉语言任务上取得了显著的性能。然而,LVLMs 仍然会产生与视觉输入矛盾的文本,导致幻觉现象。现有研究主要关注缓解对象幻觉,却常常忽视更复杂的关系幻觉,尤其是涉及对象之间相互作用的动作关系。在本研究中,我们经验性地观察到,动作-关系幻觉的主要原因是对视觉信息分配的注意力不足。因此,我们提出了一个框架来定位与动作相关的图像区域,并增强 LVLMs 对这些区域的注意力。具体而言,我们定义了动作-关系灵敏度 (ARS) 分数来识别对动作-关系变化最敏感的注意力头,从而局部化包含关键视觉线索的动作相关图像区域。然后,我们提出了关系感知视觉增强 (RVE) 方法,以增强 LVLMs 对这些动作相关图像区域的注意力。大量实验表明,与现有基线方法相比,我们的方法在缓解动作-关系幻觉方面性能卓越,同时几乎没有额外的推理成本。此外,它有效地泛化到空间关系幻觉和对象幻觉。

关键词

引用

@article{arxiv.2605.11808,
  title  = {Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement},
  author = {Zhenxin Qin and Qiang Li and Qingzhuo Wang and Ruiyang Qin and Zhihua Wei and Wen Shen},
  journal= {arXiv preprint arXiv:2605.11808},
  year   = {2026}
}