MCA-LLaVA: 曼哈顿因果注意力用于降低大型视觉语言模型中的幻觉
计算机视觉与模式识别
2025-07-24 v2
摘要
幻觉是大型视觉语言模型(LVLMs)面临的重大挑战,多模态特征之间的对齐失调被 identified 为关键因素之一。本文揭示了旋转位置编码(RoPE)在 LVLMs 中用于位置建模的长期衰减对多模态对齐产生的负面影响。具体而言,在长期衰减条件下,指令 token 对位于二维空间中不同位置的图像 token 表现出不均等的感知:优先感知因在一维序列中与指令 token 位置更接近而位于底部右侧区域的图像 token。这种偏置感知导致图像-指令互动不足及多模态对齐次 suboptimal。我们将这一现象称为图像对齐偏置。为增强指令对不同空间位置图像 token 的感知,本文提出了基于曼哈顿距离的 MCA-LLaVA,扩展了长期衰减为二维、多方向的空间衰减。MCA-LLaVA 集成了一维序列顺序与图像 token 的二维空间位置,用于位置建模,从而通过缓解图像对齐偏置来减轻幻觉。MCA-LLaVA 在各种幻觉和通用基准上的实验结果表明其有效性和普适性。代码可在 https://github.com/ErikZ719/MCA-LLaVA 查阅。
引用
@article{arxiv.2507.09184,
title = {MCA-LLaVA: Manhattan Causal Attention for Reducing Hallucination in Large Vision-Language Models},
author = {Qiyan Zhao and Xiaofeng Zhang and Yiheng Li and Yun Xing and Xiaosong Yuan and Feilong Tang and Sinan Fan and Xuhang Chen and Xuyao Zhang and Dahan Wang},
journal= {arXiv preprint arXiv:2507.09184},
year = {2025}
}
备注
Accepted in ACM MM 2025