中文

ReasonMap:面向铁路图的细粒度视觉推理

计算机视觉与模式识别 2026-03-13 v3 人工智能 计算与语言

摘要

多模态大语言模型 (MLLM) 在语义场景理解和文本图像对齐方面已取得显著进展,推理变体也提升了涉及数学和逻辑的更复杂任务性能。为弥合这一差距,我们引入 ReasonMap,这是一个专为评估这些能力而设计的新型基准。ReasonMap 包含 30 个城市的高分辨率铁路图,并包含 1008 对问答对,覆盖两种问题类型和三个模板。我们设计了两级评估管道,正确评估答案的正确性和质量。我们对 16 个流行 MLLM进行全面评估,发现一种反直觉模式:在开源模型中,基础变体反而优于其推理调优版本,而在闭源模型中则存在相反趋势。进一步的视觉遮蔽实验确认,优异性能需要直接的视觉 grounding,而不能仅依赖语言先验。我们进一步通过强化微调建立了训练基线,为未来探索提供了参考。我们希望本基准研究为视觉推理提供新见解,并帮助阐明开源与闭源模型之间的差距。

关键词

引用

@article{arxiv.2505.18675,
  title  = {ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps},
  author = {Sicheng Feng and Song Wang and Shuyi Ouyang and Lingdong Kong and Zikai Song and Jianke Zhu and Huan Wang and Xinchao Wang},
  journal= {arXiv preprint arXiv:2505.18675},
  year   = {2026}
}

备注

CVPR 2026, website: https://fscdc.github.io/ReasonMap/