面向动态双足运动-操纵的偏好驱动多模态策略
机器人学
2025-10-10 v3
摘要
动态 loco-操纵需要有效的全身控制和与物体及环境之间的接触丰富的交互。现有的基于学习的控制合成依赖于训练低层技能策略并通过高层策略或人工设计的有限状态机显式切换,导致准静态行为。相反,诸如足球等动态任务需要机器人朝球跑动、减速至最佳接近方式进行控制并最终踢中球门——一系列平滑的运动。为此,我们提出了偏好驱动的 Oracle 指导的多模态策略(OGMP),通过受限探索学习单一策略以掌握所有所需模式及其过渡的偏好序列,以解决单对象 loco-操纵任务。我们将混合自动机设计为 Oracle,用于生成具有连续动力学和离散模式跳跃的参考,以执行受导策略优化。为强制学习所需的模式过渡序列,我们提出了一种任务无关的偏好奖励以提高性能。该方法在 soccer 等 loco-操纵任务中成功实现了操纵,通过全身控制实现单对象 loco-操纵。 在 soccer 中,单一策略学习最优到达球、过渡到接触丰富的控制并执行成功的 goal kick 和球停止。凭借 Oracle 的抽象,我们在包括 HECTOR V1、Berkeley Humanoid、Unitree G1 和 H1 在内的不同形态机器人上解决了每个 loco-操纵任务,使用相同的奖励定义和权重。
引用
@article{arxiv.2410.01030,
title = {Preferenced Oracle Guided Multi-mode Policies for Dynamic Bipedal Loco-Manipulation},
author = {Prashanth Ravichandar and Lokesh Krishna and Nikhil Sobanbabu and Quan Nguyen},
journal= {arXiv preprint arXiv:2410.01030},
year = {2025}
}
备注
7 pages, 8 figures