基于特权动作的强化学习长期机器人操控技能学习
机器人学
2025-02-24 v1
摘要
长期接触丰富的任务在强化学习中具有挑战性,由于稀疏奖励导致高维状态空间的探索效果不佳。学习过程常陷入局部最优,要求复杂情景下的任务特定奖励微调。在本工作中,我们提出了一种结构化框架,利用特权动作配合课程学习,使策略能够在无需 extensive 奖励工程或参考轨迹的情况下高效获取长期技能。具体而言,我们在仿真环境中使用特权动作,采用通用的训练程序,这种程序在现实世界中难以实现。这些特权包括放宽约束和虚拟力,以增强与物体的交互和探索。我们的结果成功实现了复杂的多阶段长期任务,这些任务自然地将非抓取操控与抓取相结合,以从不可抓取的姿态中提升物体。我们通过保持简洁的奖励结构并在各种环境中展示收敛到多样且稳健行为的通用性来证明其普适性。此外,实验进一步确认了使用我们方法获取的技能可迁移到现实环境,表现出稳健且复杂的性能。我们的方法在这些任务中超越了最先进的方法,收敛到其他方法失败的解决方案。
引用
@article{arxiv.2502.15442,
title = {Learning Long-Horizon Robot Manipulation Skills via Privileged Action},
author = {Xiaofeng Mao and Yucheng Xu and Zhaole Sun and Elle Miller and Daniel Layeghi and Michael Mistry},
journal= {arXiv preprint arXiv:2502.15442},
year = {2025}
}