TopViewRS:面向顶视图空间推理的视觉语言模型
计算与语言
2025-05-26 v3 机器学习
摘要
顶视图视角是人类阅读和推理不同类型地图的典型方式,对人类以及由大型视觉语言模型(VLMs)支持的“非人类”代理的定位和导航至关重要。尽管如此,现代 VLMs 的空间推理能力仍未得到充分评估和探索。本文因此研究了它们理解和推理来自顶视图的空间关系的能力。关注顶视图也使我们能够在空间推理的不同细粒度水平上进行受控评估;我们清晰地分离了不同的能力(例如,识别特定对象 versus 理解它们的相对位置)。我们引入了 TopViewRS(Top-View Reasoning in Space)数据集,包含 11,384 个多选问题,作为视觉输入的真实或语义顶视图地图。我们随后将其用于评估 VLMs 在 4 个感知和推理任务中的表现,这些任务的复杂度不同。对 10 个代表性的开放式和闭源 VLMs 的评估显示,与平均人类水平性能相比,其间隔超过 50%,在某些情况下甚至低于随机基线。尽管额外实验表明,链式思考推理可使模型能力平均提升 5.82%,但总体而言,VLMs 的性能仍有限。我们的发现凸显了在顶视图空间推理中增强模型能力的关键需求,并为进一步研究 VLMs 在真实世界多模态任务中达到人类水平 proficiency 奠定了基础。
引用
@article{arxiv.2406.02536,
title = {Mitigate Position Bias in Large Language Models via Scaling a Single Dimension},
author = {Yijiong Yu and Huiqiang Jiang and Xufang Luo and Qianhui Wu and Chin-Yew Lin and Dongsheng Li and Yuqing Yang and Yongfeng Huang and Lili Qiu},
journal= {arXiv preprint arXiv:2406.02536},
year = {2025}
}
备注
Accepted at Findings of ACL 2025