关于梯度主导性与LQR策略优化的若干观察
机器学习
2025-07-17 v2
摘要
优化问题的解,包括强化学习中的策略优化,通常依赖于梯度下降的某种变体。在机器学习、控制和优化领域,近期大量研究将Polyak-{\L}ojasiewicz不等式(PLI)应用于此类问题,以建立损失函数在梯度流下收敛至最小值时呈指数收敛率(即数值分析中所谓的“局部迭代”语言下的“线性收敛”)。然而,对于初始条件较大的情形(如连续时间LQR问题的策略迭代),该收敛速率会消失,导致混合的全局线性/局部指数行为;而离散时间LQR问题则存在全局指数收敛。这一CT与DT行为之间的差异激发了对各种类PLI条件的探索,而本报告将关注该主题。此外,这些推广条件对于理解梯度估计误差的暂态与渐近效应至关重要——这些误差可能源于对抗性攻击、oracle错误评估、仿真提前停止、不准确或极度粗略的数字孪生体、随机计算(算法“可重复性”)或从有限数据中进行采样学习。我们描述了一种“输入到状态稳定性”(ISS)分析。第二部分讨论了在反馈控制中应用的“线性前馈神经网络”的收敛性与PLI类性质。本工作的大部分内容是与Arthur Castello B. de Oliveira、Leilei Cui、Zhong-Ping Jiang和Milad Siami合作完成的。
引用
@article{arxiv.2507.10452,
title = {Some remarks on gradient dominance and LQR policy optimization},
author = {Eduardo D. Sontag},
journal= {arXiv preprint arXiv:2507.10452},
year = {2025}
}
备注
This is a short paper summarizing the first part of the slides presented at my keynote at the 2025 L4DC (Learning for Dynamics & Control Conference) in Ann Arbor, Michigan, 05 June 2025. A partial bibliography has been added