中文

See, Remember, Explore: 面向流式空间推理的基准与基线

计算机视觉与模式识别 2026-03-26 v1

摘要

空间理解是具身智能体的基本能力,但大多数空间 VLMs 和基准仍基于离线评估,对事后问答进行事后处理,忽视了两个关键部署要求:长期流式推理和主动感知当当前视图不足时。为此,我们引入 S3-Bench,一套用于具有主动探索的流式空间问答基准,查询在特定时间戳上具有时空 grounding,必须仅使用到该时刻为止可用的观察来作答。S3-Bench 采用双域设计,结合可控制轨迹和探索动作的可扩展模拟器,以及捕获实际感知 artifacts 的真实世界流式视频,以进行严格的泛化评估。总体而言,它涵盖 10K+ 场景和 26K+ 轨迹,包含专门的训练(S3-Train)和评估(S3-Eval)子集。我们进一步提出了 AMF-VLM,支持在受限计算资源下的流式空间推理:(i) 记忆折叠,将长期观察压缩为紧凑结构化记忆;(ii) 主动探索,输出显式动作(如移动/旋转/扫描)以获取缺失证据后再作答。大量实验表明,与使用相同训练数据的模型相比,我们的方法在 S3-Eval 的模拟和真实子集上分别提升了 8.8% 和 13.3%,同时保持了对标准空间基准的有竞争力迁移能力。

关键词

引用

@article{arxiv.2603.23864,
  title  = {See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning},
  author = {Yuxi Wei and Wei Huang and Qirui Chen and Lu Hou and Xiaojuan Qi},
  journal= {arXiv preprint arXiv:2603.23864},
  year   = {2026}
}