中文

超越 LQR 中的二次代价:Bregman 散度控制

系统与控制 2025-05-02 v1 系统与控制 最优化与控制

摘要

过去二十年间,“非二次”凸代价函数的使用彻底改变了信号处理、机器学习和统计学,使得人们能够定制具有所需结构和性质的解。然而,在控制领域,情况并非如此,二次代价的使用仍占主导地位,表面上的原因是,一旦考虑一般的凸代价,确定对构建最优控制器至关重要的“值函数”(即最优期望代价-to-go)在计算上变得难以处理。因此,实践者常常求助于启发式方法和近似方法,例如仅向前看几步的模型预测控制。在二次情况下,值函数可通过求解 Riccati 方程轻松确定。本文考虑一类由 Bregman 散度构建的特殊凸代价函数,并展示如何通过适当选择,将其用于完全扩展为二次情况开发的框架。所得的最优控制器是无限时域的,具有稳定性保证,并具有状态反馈或估计状态反馈律。由于反馈律是非线性的,它们展现出比其二次对应物更广泛的行为范围。该方法可应用于多种感兴趣的情况,包括安全控制、稀疏控制和 bang-bang 控制。

关键词

引用

@article{arxiv.2505.00317,
  title  = {Beyond Quadratic Costs in LQR: Bregman Divergence Control},
  author = {Babak Hassibi and Joudi Hajar and Reza Ghane},
  journal= {arXiv preprint arXiv:2505.00317},
  year   = {2025}
}