面向连续控制任务的鲁棒值迭代
机器学习
2021-05-27 v1 机器人学
系统与控制
系统与控制
摘要
当将控制策略从仿真迁移到物理系统时,该策略需要对动力学的变化具有鲁棒性才能表现良好。通常,近似模型及其对应状态分布上的最优策略会过拟合,常导致在底层分布偏移下迁移失败。本文提出鲁棒拟合值迭代(Robust Fitted Value Iteration),其利用动态规划在紧致状态域上计算最优值函数,并引入系统动力学的对抗扰动。这些对抗扰动促使最优策略对动力学变化具有鲁棒性。利用强化学习的连续时间视角,我们推导出了状态、动作、观测和模型参数的闭式最优扰动。值得注意的是,所得算法不需要对状态或动作进行离散化。因此,最优对抗扰动可高效地纳入极小极大值函数更新中。我们将所得算法应用于物理 Furuta 摆和 cartpole。通过改变系统质量,我们评估了不同模型参数下的定量与定性性能。我们表明,鲁棒值迭代相比深度强化学习算法及该算法的非鲁棒版本具有更强的鲁棒性。实验视频见 https://sites.google.com/view/rfvi
引用
@article{arxiv.2105.12189,
title = {Robust Value Iteration for Continuous Control Tasks},
author = {Michael Lutter and Shie Mannor and Jan Peters and Dieter Fox and Animesh Garg},
journal= {arXiv preprint arXiv:2105.12189},
year = {2021}
}
备注
Accepted Paper at Robotics: Science and Systems