EgoMI:从 egocentric 人类演示中学习主动视觉与全身操控
机器人学
2026-03-11 v2
摘要
从人类演示中进行仿照学习是一种获取机器人技能的有前景的方法,但 egocentric 人类数据引入了由于 embodiment 桥隙而导致的根本性挑战。在操控期间,人类主动协调头部和手部动作,不断 reposition 视点,并使用行动前视觉固定搜索策略来定位相关对象。这些行为创建了动态、任务驱动的头部运动,以至于静态机器人感知系统无法复制,导致显著的分布迁移,降低策略性能。我们提出 EgoMI(Egocentric Manipulation Interface),一个捕获操控任务中同步 end-effector 与主动头部轨迹的框架,产生可 retarget 给兼容的半人形机器人 embodiment 的数据。为处理快速且广泛的头部视点变化,我们引入一个记忆增强的策略, selectively 融合历史观察。我们在配备 actuated 摄像头头部的双手机器人上评估了该方法,发现具有显式头部运动建模的策略持续优于基线方法。结果表明,EgoMI 的协调手眼学习有效桥接了人类-机器人 embodiment 桥隙,实现了半人形 embodiment 上稳健的仿照学习。项目页面: https://egocentric-manipulation-interface.github.io
引用
@article{arxiv.2511.00153,
title = {EgoMI: Learning Active Vision and Whole-Body Manipulation from Egocentric Human Demonstrations},
author = {Justin Yu and Yide Shentu and Di Wu and Pieter Abbeel and Ken Goldberg and Philipp Wu},
journal= {arXiv preprint arXiv:2511.00153},
year = {2026}
}