RecoveryChaining:用于稳健操作的本地恢复策略学习
机器人学
2025-03-10 v2 人工智能
摘要
模型基准的规划器和控制器常用于解决复杂操作问题,因为它们能够高效优化多样化目标并泛化到长期程度任务。然而,这些方法在部署时常因噪声驱动、部分可观测性和不完美模型而失败。为使机器人能够从此类失败中恢复,我们提出使用分层强化学习来学习恢复策略。该恢复策略在检测到基于感官观测的失败后触发,旨在将机器人带到可使用正规模型基准控制器完成任务的状态。我们的方法称为 RecoveryChaining,采用混合动作空间,其中将模型基准控制器作为额外的 \emph{nominal} 选项提供,从而允许恢复策略决定如何恢复、何时切换到正规控制器以及切换到哪个控制器,即便面临 \emph{稀疏奖励}。我们在三个带有稀疏奖励的多步骤操作任务中评估了该方法,其中它学习的恢复策略显著比基线方法更具稳健性。我们成功地将在仿真中学习的恢复策略迁移到物理机器人,展示了该方法实现 sim-to-real 迁移的可行性。
引用
@article{arxiv.2410.13979,
title = {RecoveryChaining: Learning Local Recovery Policies for Robust Manipulation},
author = {Shivam Vats and Devesh K. Jha and Maxim Likhachev and Oliver Kroemer and Diego Romeres},
journal= {arXiv preprint arXiv:2410.13979},
year = {2025}
}
备注
Added Lazy RecoveryChaining algorithm. 8 pages, 9 figures