中文

时空大语言模型:关于环境与动作的推理

计算机视觉与模式识别 2025-10-16 v2 机器学习

摘要

尽管多模态大语言模型(MLLMs)近期取得了显著进展,但当前的 MLLMs 在处理“时空”提示时仍面临挑战,即这些提示同时涉及:1)以点云编码的、MLLM 应予以考虑的完整环境;以及 2)发生在部分环境中并以短时第一视角视频片段编码的动作。然而,这种整体的时空理解对于在现实世界中运行的智能体至关重要。为应对这一挑战,我们首先开发了一个框架来收集大规模数据集。利用收集到的“关于环境与动作的推理”(REA)数据集,我们展示了近期的 MLLMs 确实难以正确回答“时空”提示。基于该数据集,我们研究了两种时空大语言模型(STLLM)基线:1)STLLM-3D,将点云、视频和文本表示直接融合作为 LLM 的输入;以及 2)STLLM-Aligner,在 LLM 解码前将空间上下文与视频和文本进行对齐。两种基线均旨在增强对环境的空间理解和对第一视角观察的时间定位。在 REA 上,STLLM 基线优于现有模型,证明了我们设计的有效性。代码和数据可在 https://zoezheng126.github.io/STLLM-website/ 获取。

关键词

引用

@article{arxiv.2507.05258,
  title  = {Spatio-Temporal LLM: Reasoning about Environments and Actions},
  author = {Haozhen Zheng and Beitong Tian and Mingyuan Wu and Zhenggang Tang and Klara Nahrstedt and Alex Schwing},
  journal= {arXiv preprint arXiv:2507.05258},
  year   = {2025}
}

备注

Code and data are available at https://zoezheng126.github.io/STLLM-website/