OST-Bench:评估多模态大语言模型在线时空场景理解能力
计算机视觉与模式识别
2025-10-15 v2
摘要
多模态大语言模型(MLLM)的最新进展在整合视觉和语言进行复杂推理方面显示出卓越能力。虽然大多数现有基准在离线设置下使用固定的预记录输入集评估模型,但我们引入了OST-Bench,这是一个旨在从主动探索场景的智能体角度评估在线时空理解的基准。在线方面强调处理增量获取的观测并对其进行推理的需求,而时空组件则要求将当前视觉输入与历史记忆相结合以支持动态空间推理。OST-Bench更好地反映了现实世界具身感知的挑战。基于高效的数据收集流程,OST-Bench包含从ScanNet、Matterport3D和ARKitScenes收集的1.4k个场景和10k个问答对。我们在OST-Bench上评估了几个领先的MLLM,并观察到它们在需要复杂时空推理的任务上表现不足。在在线设置下,随着探索范围延长和记忆增长,它们的准确性下降。通过进一步的实验分析,我们识别了跨模型的常见错误模式,并发现复杂的基于线索的空间推理需求和长期记忆检索需求分别沿两个独立轴显著降低模型性能,这突出了改进在线具身推理必须解决的核心挑战。为了促进该领域的进一步研究和发展,我们的代码、数据集和基准均已公开。我们的项目页面是:https://rbler1234.github.io/OSTBench.github.io/
引用
@article{arxiv.2507.07984,
title = {OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding},
author = {Jingli Lin and Chenming Zhu and Runsen Xu and Xiaohan Mao and Xihui Liu and Tai Wang and Jiangmiao Pang},
journal= {arXiv preprint arXiv:2507.07984},
year = {2025}
}
备注
30 pages, a benchmark designed to evaluate Online Spatio-Temporal understanding from the perspective of an agent actively exploring a scene. Project Page: https://rbler1234.github.io/OSTBench.github.io/