可微鲁棒LQR层
机器人学
2021-06-11 v1 机器学习
摘要
本文提出一种可微鲁棒LQR层,用于模型不确定性与随机动力学下的强化学习与模仿学习。该鲁棒LQR层可利用鲁棒最优控制与无模型学习的优势,为控制系统中随机性与不确定性的建模提供了一种新型归纳偏置。具体而言,我们通过将鲁棒LQR优化问题重写为最坏情况代价的凸规划(即半定规划),提出了一种高效的对该优化程序求导的方法。基于近期在神经网络层内使用凸优化的工作,我们开发了一个完全可微的层来优化该最坏情况代价,即计算性能指标关于模型未知参数、模型不确定性与随机性参数的导数。我们在随机与不确定域上的模仿学习与近似动态规划中演示了所提方法。实验结果表明,该方法能在不确定情形下优化鲁棒策略,且相比现有不直接建模不确定性的方法取得显著更优的性能。
引用
@article{arxiv.2106.05535,
title = {Differentiable Robust LQR Layers},
author = {Ngo Anh Vien and Gerhard Neumann},
journal= {arXiv preprint arXiv:2106.05535},
year = {2021}
}
备注
10 pages