面向 4D 时空空间的视觉-语言模型检索增强推理
计算机视觉与模式识别
2025-12-19 v1 机器人学
摘要
人类通过构建持久且结构化的内部表征来感知和推理周围环境,这些表征编码了语义意义、空间布局和时间动态。这些多模态记忆使他们能够回忆过去事件、推断未观察到的状态,并将新信息整合到情境依赖的推理中。鼓励这种能力的,我们引入 R4,一个面向 4D 时空空间的检索增强推理框架,为视觉-语言模型 (VLM) 提供结构化、持久的记忆。R4 持续构建 4D 知识数据库,通过将对象级语义描述锚定在度量空间和时间上,形成可跨智能体共享的持久世界模型。在推理时,自然语言查询被分解为语义、空间和时间关键词,用于检索相关观察,进而整合到 VLM 的推理中。与经典检索增强生成方法不同,R4 在 4D 空间中直接进行检索,实现无需训练的情景式和协作式推理。在具身问答和导航基准测试中,实验表明 R4 在时空信息检索和推理方面显著优于基线方法,推动了动态环境下具身 4D 推理的新范式。
引用
@article{arxiv.2512.15940,
title = {R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space},
author = {Tin Stribor Sohn and Maximilian Dillitzer and Jason J. Corso and Eric Sax},
journal= {arXiv preprint arXiv:2512.15940},
year = {2025}
}