中文

穿越放大镜:基于注意力的自适应感知放大以实现无幻觉的视觉-语言模型解码

计算机视觉与模式识别 2026-04-10 v4 人工智能

摘要

现有的视觉-语言模型 (VLM) 常常因视觉幻觉问题而受限,即生成的响应包含不基于视觉输入的 inaccuracy。旨在解决此问题的尝试主要通过对比性减少语言偏见或放大视觉嵌入的权重来缓解幻觉,但这些方法在捕获细粒度视觉细节方面仍受限。本文提出了感知放大器 (Perception Magnifier, PM),这是一种新的视觉解码方法,通过注意力迭代隔离相关视觉标记并放大相应区域,促使模型在解码过程中集中注意力于细粒度视觉细节。通过在保持每个解码步骤中结构和上下文信息的同时放大关键区域,PM 允许 VLM 增强对视觉输入的审视,从而产生更准确、更可靠的响应。大量实验结果表明,PM 不仅在幻觉缓解方面取得优异成绩,还在保持强推理能力的同时提升了语言生成质量。代码可在 https://github.com/ShunqiM/PM 查阅。

关键词

引用

@article{arxiv.2503.10183,
  title  = {Through the Magnifying Glass: Adaptive Perception Magnification for Hallucination-Free VLM Decoding},
  author = {Shunqi Mao and Chaoyi Zhang and Weidong Cai},
  journal= {arXiv preprint arXiv:2503.10183},
  year   = {2026}
}

备注

ACL 2026 Main Conference