中文

ChainMPQ:交错文本-图像推理链以缓解关系幻觉

计算机视觉与模式识别 2026-03-03 v2 人工智能

摘要

尽管大视觉语言模型(LVLMs)在多模态任务中取得了强劲性能,但幻觉现象仍然阻碍着它们的可靠性。在三种幻觉类别中——包括目标幻觉、属性幻觉和关系幻觉——关系幻觉占比最大,但受到的关注最少。为解决这一问题,我们提出了ChainMPQ(多视角提问引导的图像与文本交错链,Multi-Perspective Questions guided Interleaved Chain of Image and Text),一种通过利用累积的文本和视觉记忆来提升LVLMs中关系推理能力的免训练方法。ChainMPQ首先从问题中提取目标和客体关键词以增强相应的图像区域。然后构建聚焦于关系三个核心组成部分——主体、客体和连接它们的关系——的多视角问题。这些问题被依次输入模型,前面步骤中的文本和视觉记忆为后续步骤提供支持上下文,从而形成交错的图像与文本链,引导渐进式关系推理。在多个LVLMs和基准数据集上的实验表明,ChainMPQ显著减少了关系幻觉,而消融研究进一步验证了其三个核心模块的有效性。

关键词

引用

@article{arxiv.2510.06292,
  title  = {ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations},
  author = {Yike Wu and Yiwei Wang and Yujun Cai},
  journal= {arXiv preprint arXiv:2510.06292},
  year   = {2026}
}

备注

Accepted by ICLR2026