中文

PostAlign:作为多模态 grounding 工具的 MLLMs

计算机视觉与模式识别 2025-06-24 v1

摘要

多模态大语言模型 (MLLMs) 在图像字幕和视觉问答等视觉语言任务中表现突出, 但常因对虚假关联的过度依赖而受限, 这种依赖主要源于语言先验, 使模型无法充分利用实际视觉信息. 为此, 本文引入 MMGrounded-PostAlign, 一个后置多模态对齐框架, 旨在增强视觉理解能力并缓解 MLLMs 的幻觉现象. 框架集成了用于视觉 grounding 和文本 grounding 的多模态 grounding 模块, 前者识别图像中指代对象, 后者生成最终答案的论证依据, 确保输出同时以视觉和文本证据为依托. 为缓解幻觉, 在视觉 grounding 模块中引入负向 rejection 机制, 以区分 grounding 实体与受语言偏置影响的不存在对象. 在文本 grounding 方面, 提出选择性推理机制, 根据查询复杂度调整模型的推理策略. 在 POPE、HaloQuest、VQAv2、MME 和 MMBench 等基准测试上进行了广泛评估, 显示出在细粒度视觉理解和幻觉抑制方面显著优于现有方法.

关键词

引用

@article{arxiv.2506.17901,
  title  = {PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs},
  author = {Yixuan Wu and Yang Zhang and Jian Wu and Philip Torr and Jindong Gu},
  journal= {arXiv preprint arXiv:2506.17901},
  year   = {2025}
}