中文

PRISM:面向单次多感知模仿学习的Performer RS-IMLE

机器人学 2026-02-03 v1 机器学习

摘要

机器人模仿学习通常需要捕获多模态动作分布的模型,同时以实时控制速率运行并适应多种感知模态。尽管最近的生成方法,如扩散模型、流匹配和隐式最大似然估计 (IMLE) 已取得鼎舞成果,但往往只满足上述要求的子集。为此,我们引入 PRISM,一种基于 IMLE 的批量全局拒绝抽样变体的单次策略。PRISM 将多感知编码器(整合 RGB、深度、触觉、音频和本体感知)与采用 Performer 架构的线性注意力生成器耦合在一起。我们在多样化的真实硬件平台上展示了 PRISM 的有效性,包括使用带有 7 自由度机械臂 D1 的 Unitree Go2 进行 locomotion-操纵,以及使用 UR5 机械臂进行桌面操纵。在诸如事前操纵停靠、高精度插入和多物体抓取和放置等具有挑战性的物理任务中,PRISM 在成功率上超过最先进的扩散策略 10-25%,同时保持高频率 (30-50 Hz) 的闭环控制。我们进一步在大规模仿真基准测试中验证了该方法,包括 CALVIN、MetaWorld 和 Robomimic。在 CALVIN (10% 数据分割) 中,PRISM 在扩散和约 20% 的流匹配之上提高了约 25% 的成功率,同时将轨迹抖动降低了 20 倍至 50 倍。这些结果将 PRISM 定位为一种快速、精确且具多感知覆盖性的模仿策略,无需迭代抽样即可实现低延迟。

关键词

引用

@article{arxiv.2602.02396,
  title  = {PRISM: Performer RS-IMLE for Single-pass Multisensory Imitation Learning},
  author = {Amisha Bhaskar and Pratap Tokekar and Stefano Di Cairano and Alexander Schperberg},
  journal= {arXiv preprint arXiv:2602.02396},
  year   = {2026}
}

备注

10 pages main text and 4 figures, and 11 pages appendix and 10 figures, total 21 pages and 14 figures