共同看见:基于多模态大语言模型的多机器人协同自我中心空间推理
计算机视觉与模式识别
2026-05-20 v2
摘要
多模态大语言模型(MLLM)在自我中心视频理解方面取得了实质性进展,但其从多个具身视角进行协同推理的能力在很大程度上仍未被探索。我们通过多机器人协同动态空间推理来研究这一问题,其中模型必须通过整合来自一组移动机器人的同步自我中心视频,来回答空间、时间、可见性和协调性问题。为了支持这一设定,我们引入了 CoopSR,这是针对该任务的首个基准,以及一个多机器人自我中心问答数据集 EgoTeam。EgoTeam 包含 114,227 个问答对,涵盖 19 种问题类型、四个难度等级和三种团队规模,数据来自 Habitat 和 iGibson,此外还有一个使用两台四足机器人收集的约 2,326 个问答的真实世界测试集。我们进一步提出了 SP-CoR(Spectral and Physics-Informed Cooperative Reasoner),一个用于细粒度协同空间推理的 MLLM 框架。SP-CoR 结合了动力学感知的多机器人帧采样、频谱与物理引导的视图融合以及物理对齐的提示蒸馏,使模型能够在训练期间受益于特权机器人位姿监督,而在测试时仅需自我中心视频。在 22 个 MLLM 基线上,SP-CoR 持续提升协同推理性能,在 Habitat 上比最强的微调基线高出 +3.87%,在 iGibson 上高出 +7.12%。它还展示了对未见团队规模和真实世界机器人测试更强的泛化能力。代码可在 https://github.com/KPeng9510/seeing-together.git 找到。
引用
@article{arxiv.2605.18431,
title = {Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models},
author = {Kunyu Peng and Zhikun Zhou and Kailun Yang and Di Wen and Ruiping Liu and Yufan Chen and Junwei Zheng and Hao Shi and Yi Zhou and M. Saquib Sarfraz and Danda Pani Paudel and Luc Van Gool},
journal= {arXiv preprint arXiv:2605.18431},
year = {2026}
}