中文

ST-Think:从 ego-centric 视频理解 4D 世界的多模态大语言模型如何进行空间-时间推理

计算机视觉与模式识别 2025-04-24 v2

摘要

人类在空间-时间推理方面卓越,能轻松地从第三人称视角解释动态视觉事件。然而,多模态大语言模型(MLLMs)是否能够类似地理解 4D 世界仍不确定。本文从第三人称视角探索多模态空间-时间推理,旨在为 MLLMs 提供类人推理能力。为支持这一目标,我们引入了 Ego-ST Bench,一个包含超过 5000 个问答对的新基准,涵盖四个类别,系统评估空间、时间和集成空间-时间推理。此外,我们提出了 ST-R1 训练范式,一种基于视频的推理模型,其强化学习过程中融入逆向思维,显著提升了性能。我们将长链-of-thought(long-CoT)监督微调与 Group Relative Policy Optimization(GRPO)强化学习相结合,在有限的高质量数据下取得显著的改进。Ego-ST Bench 和 ST-R1 为推进基于视频的空间-时间推理研究提供了宝贵的见解和资源。

关键词

引用

@article{arxiv.2503.12542,
  title  = {ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos},
  author = {Peiran Wu and Yunze Liu and Miao Liu and Junxiao Shen},
  journal= {arXiv preprint arXiv:2503.12542},
  year   = {2025}
}