线性二次控制中策略梯度的隐式偏差:对外推至未见初始状态的研究
机器学习
2024-06-04 v2 人工智能
系统与控制
系统与控制
机器学习
摘要
在现代机器学习中,模型通常可以通过多种方式拟合训练数据,其中一些在未见(测试)数据上表现良好,而另一些则不然。值得注意的是,在这种情况下,梯度下降经常表现出一种隐式偏差,从而在未见数据上获得卓越性能。这种隐式偏差在监督学习中得到了广泛研究,但在最优控制(强化学习)中却知之甚少。在那里,通过梯度下降学习应用于系统的控制器被称为策略梯度,一个至关重要的问题是学习到的控制器在多大程度上可以外推至未见的初始状态。本文从理论上研究了策略梯度在外推至未见初始状态方面的隐式偏差。聚焦于基础的线性二次调节器(LQR)问题,我们确立了外推程度取决于系统在从包含在训练中的初始状态开始时所诱导的探索程度。实验证实了我们的理论,并在 LQR 之外的问题(其中系统是非线性的且控制器是神经网络)上展示了其结论。我们假设,通过开发用于知情选择训练初始状态的方法,可以极大地改善现实世界中的最优控制。
引用
@article{arxiv.2402.07875,
title = {Implicit Bias of Policy Gradient in Linear Quadratic Control: Extrapolation to Unseen Initial States},
author = {Noam Razin and Yotam Alexander and Edo Cohen-Karlik and Raja Giryes and Amir Globerson and Nadav Cohen},
journal= {arXiv preprint arXiv:2402.07875},
year = {2024}
}
备注
Accepted to ICML 2024