Residual-MPPI:面向连续控制的在线策略定制
机器人学
2025-03-17 v5
摘要
通过强化学习 (RL) 和模仿学习 (IL) 开发的策略在连续控制任务中展现出巨大潜力,但实际应用通常需要将训练好的策略适应于不可预见的需求。虽然微调可以解决此类需求,但通常需要额外的数据以及对原始训练指标和参数的访问权限。相比之下,在线规划算法如果能够满足额外要求,则可消除对大量训练阶段的需求,并在不了解原始训练方案或任务的情况下定制策略。在这项工作中,我们提出了一种用于在执行时定制连续控制策略的通用在线规划算法,我们称之为 Residual-MPPI。在仅需访问先验动作分布的情况下,它可以在少样本甚至零样本在线设置下,根据新的性能指标定制给定的先验策略。通过实验,我们证明了所提出的 Residual-MPPI 算法能够有效完成少样本/零样本在线策略定制任务,包括在极具挑战性的赛车场景 Gran Turismo Sport (GTS) 环境中,定制冠军级赛车智能体 Gran Turismo Sophy (GT Sophy) 1.0。MuJoCo 实验的代码包含在补充材料中,将在论文被接收后开源。演示视频和代码可在我们的网站获取:https://sites.google.com/view/residual-mppi。
引用
@article{arxiv.2407.00898,
title = {Residual-MPPI: Online Policy Customization for Continuous Control},
author = {Pengcheng Wang and Chenran Li and Catherine Weaver and Kenta Kawamoto and Masayoshi Tomizuka and Chen Tang and Wei Zhan},
journal= {arXiv preprint arXiv:2407.00898},
year = {2025}
}