AttAnchor:利用注意力锚点引导视觉语言模型中的跨模态令牌对齐
人工智能
2025-09-30 v1 计算机视觉与模式识别
摘要
注意力机制在 LLMs 中优于 RNNs 和 LSTMs 的一个根本原因,在于其能通过建模所有令牌间的直接交互来捕获长距离依赖,克服了循环架构的顺序限制。类似地,当今视觉语言模型(VLMs)产生幻觉且性能不及纯语言模型的一个关键原因是,它们依赖于图像和文本令牌的直接拼接,并采用模态盲的位置编码,这虽然方便地采用了预训练的 LLM 骨干,但迫使语义相关的跨模态令牌之间进行不必要的长距离注意力计算。这凸显了对能有效增强令牌局部性和跨模态对齐机制的迫切需求。为此,我们提出了 Attention Anchor,一个无参数框架,能高效地将跨模态语义相似的令牌分组,改善跨模态局部性。通过将文本令牌插入到相关视觉块附近,我们创建了语义路标,揭示真实的基于内容的跨模态注意力分数,引导模型在 VQA、MMBench 和 POPE 等任务中聚焦于正确的图像区域。这提高了答案准确性并减少了幻觉,同时不破坏提示的语义流。AttAnchor 在 15 个不同指标和基准中的 13 个上取得了改进,包括在推理任务上高达 32% 的提升,在幻觉基准上高达 15% 的提升。AttAnchor 使 TinyLLaVA 1B 在 POPE 上超越了 LLaVA 7B 和 QwenVL 3B 等大得多的模型,且推理时间开销仅为 0.1%。据我们所知,这项工作是首批研究混合模态令牌分组的工作之一,其中文本和图像令牌被联合聚类到共享组中,而不是在单一模态内分组或仅通过额外的对齐损失进行事后对齐。
引用
@article{arxiv.2509.23109,
title = {AttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention Anchors},
author = {Junyang Zhang and Tianyi Zhu and Thierry Tambe},
journal= {arXiv preprint arXiv:2509.23109},
year = {2025}
}
备注
31 pages, 17 figures