中文

Kinaema:一种用于运动中记忆与姿态的递归序列模型

机器人学 2025-10-24 v1 计算机视觉与模式识别

摘要

空间感知机器人一个关键能力是“确定自身位置”,即正确地将自身置于之前看到的空间中。本文聚焦于连续机器人操作的这一场景,其中在实际剧集开始之前观察到的信息被用于优化效率。我们引入一种新模型Kinaema及智能体,能够在可能出现的大场景中集成移动期间的视觉观察流,并在需要时处理查询图像,预测所显示空间相对于当前位置的相对位置。我们的模型不显式存储观察历史,因此没有对上下文长度的硬性限制。它维护一个隐式潜在记忆,通过一种以递归方式更新的变压器来压缩传感器读取的历史记录为紧凑表示。我们评估了该模型在一种称为“Mem-Nav”的新下游任务中的影响。我们展示,大容量递归模型保持了有用的场景表示,能够导航到实际剧集开始前观察到的目标,并在计算效率方面表现优异,尤其是与在观察历史上进行注意力的经典变压器相比。

关键词

引用

@article{arxiv.2510.20261,
  title  = {Kinaema: a recurrent sequence model for memory and pose in motion},
  author = {Mert Bulent Sariyildiz and Philippe Weinzaepfel and Guillaume Bono and Gianluca Monaci and Christian Wolf},
  journal= {arXiv preprint arXiv:2510.20261},
  year   = {2025}
}

备注

10 pages + references + checklist + appendix, 29 pages total