中文

EgoMoD: 从局部第三人称观察预测动态全局图

机器人学 2026-03-03 v1

摘要

在动态环境中高效导航需要预测运动模式如何演化超出机器人感知范围的内容,以实现拥挤场景中的预判性而非纯反应式规划。动态图谱(Maps of Dynamics, MoDs)提供了空间运动倾向的结构化表示,对长期全局规划有用,但传统方法需要在数小时时间内获取全局环境观察。我们提出EgoMoD,是首个从机器人操作期间收集的短时第三人称视频剪辑中直接预测未来MoDs的方法。该方法通过视频和姿态条件化架构学习,从局部动态线索推断环境范围内的运动倾向,使用来自外部观察计算的MoDs作为受监督训练,使局部观察能作为全局运动结构的预测信号。凭借这一点,我们能够预测整个环境中未来运动动态,而不仅仅是延长机器人视野内过去的运动模式。在大型仿真环境中的实验表明,EgoMoD在感知受限情况下准确预测未来MoDs,而使用真实图像的评估显示其对真实系统的零样本迁移能力。

关键词

引用

@article{arxiv.2603.00167,
  title  = {EgoMoD: Predicting Global Maps of Dynamics from Local Egocentric Observations},
  author = {Iacopo Catalano and David Morilla-Cabello and Jorge Pena-Queralta and Eduardo Montijano},
  journal= {arXiv preprint arXiv:2603.00167},
  year   = {2026}
}