未知非线性系统中的在线策略优化
最优化与控制
2024-04-22 v1
摘要
我们研究了非线性时变动力系统中的在线策略优化,其中控制器不知道真实的动力学模型。这个问题具有挑战性,因为与线性系统不同,控制器无法通过局部探索获得对真实动力学的全局准确估计。我们提出了一个元框架,将通用的在线策略优化算法()与动力系统模型参数的通用在线估计器()相结合。我们证明,如果 在已知参数下诱导的假想联合动力学满足若干期望性质,那么在 提供的不精确参数下的联合动力学将对误差具有鲁棒性。重要的是,最终的策略遗憾仅取决于 对已访问轨迹的预测,这缓解了全局识别真实参数的瓶颈。为了演示我们的框架,我们开发了一种基于梯度的自适应策略选择(Gradient-based Adaptive Policy Selection)的计算高效变体,称为无记忆 GAPS(M-GAPS),并用它来实例化 。将 M-GAPS 与在线梯度下降相结合以实例化 ,产生了(据我们所知)在动力学未知的非线性时变系统中在线策略优化的首个局部遗憾界。
引用
@article{arxiv.2404.13009,
title = {Online Policy Optimization in Unknown Nonlinear Systems},
author = {Yiheng Lin and James A. Preiss and Fengze Xie and Emile Anand and Soon-Jo Chung and Yisong Yue and Adam Wierman},
journal= {arXiv preprint arXiv:2404.13009},
year = {2024}
}