VIR-Bench:通过旅行视频行程重建评估 MLLM 的地理空间与时间理解能力
计算机视觉与模式识别
2025-11-18 v2 人工智能
计算与语言
机器学习
摘要
多模态大语言模型(MLLM)的最新进展显著增强了视频理解能力,为实际应用开辟了新的可能性。然而,当前的视频基准主要关注室内场景或短距离户外活动,很大程度上未探索长距离旅行所带来的挑战。掌握扩展的地理空间-时间轨迹对于下一代MLLM至关重要,支撑着具身AI规划和导航等现实世界任务。为了弥合这一差距,我们提出了VIR-Bench,一个由200个旅行视频组成的新颖基准,该基准将行程重建设定为一项具有挑战性的任务,旨在评估并推动MLLM的地理空间-时间智能。实验结果表明,SOTA的MLLM(包括专有模型)难以获得高分,突显了处理跨越扩展空间和时间尺度的视频的困难。此外,我们进行了深入的案例研究,开发了一个利用从VIR-Bench获得的洞察的原型旅行规划智能体。该智能体显著改进的行程推荐验证了我们的评估协议不仅能有效对模型进行基准测试,还能转化为面向用户应用中的具体性能提升。
引用
@article{arxiv.2509.19002,
title = {VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction},
author = {Hao Wang and Eiki Murata and Lingfang Zhang and Ayako Sato and So Fukuda and Ziqi Yin and Wentao Hu and Keisuke Nakao and Yusuke Nakamura and Sebastian Zwirner and Yi-Chia Chen and Hiroyuki Otomo and Hiroki Ouchi and Daisuke Kawahara},
journal= {arXiv preprint arXiv:2509.19002},
year = {2025}
}
备注
AAAI 2026