中文

仿效有效做法:从人类视频中仿照学习仿真过滤的模块化策略

机器人学 2026-02-16 v1 计算机视觉与模式识别 机器学习

摘要

通过观察人类视频学习操作技能的能力,潜在地为机器人学习开辟了高度可扩展的数据来源。本文我们聚焦于精细操作,在此类任务中需要先抓取物体再执行各种后抓取动作。人类视频对学习后抓取动作提供了强信号,但对于学习先决条件抓取行为则不够,尤其是对于手部不具备人类手部特征的机器人。一个可行的办法是采用模块化策略设计,利用专门的抓取生成器产生稳定的抓取。然而,任意的稳定抓取往往不符合任务需求,阻碍机器人执行 desired 的下游动作。为此,我们提出Perceive-Simulate-Imitate(PSI),一个使用人类视频动作数据经仿真处理后筛选出配对抓取-轨迹,训练模块化操作策略的框架。这种仿真步骤将轨迹数据扩展为带有抓取适格性标签,从而实现面向任务的抓取能力的监督学习。我们通过真实世界实验表明,该框架可在无任何机器人数据的情况下高效学习精确的操作技能,显著优于直接使用抓取生成器的做法。

关键词

引用

@article{arxiv.2602.13197,
  title  = {Imitating What Works: Simulation-Filtered Modular Policy Learning from Human Videos},
  author = {Albert J. Zhai and Kuo-Hao Zeng and Jiasen Lu and Ali Farhadi and Shenlong Wang and Wei-Chiu Ma},
  journal= {arXiv preprint arXiv:2602.13197},
  year   = {2026}
}