MAPLE:从环视视频中学习的机器人灵巧操作先验编码
机器人学
2025-12-09 v2 计算机视觉与模式识别
摘要
大规模环视视频数据集捕获了跨广泛场景的多样人类活动,为洞察人类如何与物体交互(尤其是需要精细灵巧控制的物体)提供了丰富而详尽的线索。这种复杂的、需要精确控制的灵巧技能对于许多机器人操作任务至关重要,但通常不足以由传统数据驱动的方法来解决。为填补这一差距,我们利用从大规模环视视频数据集中学习的操作先验来改进针对灵巧机器人操作任务的策略学习。我们提出了 MAPLE 方法,这是一种用于灵巧机器人操作的新方法,从环视图像中学习特征以预测物体接触点和细致手部姿态。我们然后使用所学特征来训练针对下游操作任务的策略。实验结果表明,MAPLE 在 4 个现有仿真基准测试以及我们新设计的 4 个需要精细物体控制和复杂灵巧技能的挑战性仿真任务中均有效。MAPLE 的优势在使用 17 自由度灵巧机器人手进行的实际实验中得到进一步凸显,尽管在仿真和实际实验中进行的同时评估在先前工作中仍较为未探索。我们还在环视接触点预测任务中展示了我们模型的有效性,验证了其在灵巧操作策略学习之外的有用性。
引用
@article{arxiv.2504.06084,
title = {MAPLE: Encoding Dexterous Robotic Manipulation Priors Learned From Egocentric Videos},
author = {Alexey Gavryushin and Xi Wang and Robert J. S. Malate and Chenyu Yang and Davide Liconti and René Zurbrügg and Robert K. Katzschmann and Marc Pollefeys},
journal= {arXiv preprint arXiv:2504.06084},
year = {2025}
}