用于控制的 Bellman 残差最小化:几何、平稳性与收敛性
机器学习
2026-04-28 v3 系统与控制
系统与控制
摘要
马尔可夫决策问题最常通过动态规划求解。另一种方法是 Bellman 残差最小化,它直接最小化平方 Bellman 残差目标函数。然而,与动态规划相比,该方法受到的关注相对较少,主要是因为它在实践中通常效率较低,且更难扩展到无模型设置(如强化学习)。尽管如此,Bellman 残差最小化具有几个值得研究的优势,例如在使用函数逼近值函数时具有更稳定的收敛性。虽然用于策略评估的 Bellman 残差方法已被广泛研究,但用于策略优化(控制任务)的方法却鲜有探索。在本文中,我们为用于策略优化的控制 Bellman 残差最小化建立了基础性结果。
引用
@article{arxiv.2601.18840,
title = {Bellman Residual Minimization for Control: Geometry, Stationarity, and Convergence},
author = {Donghwan Lee and Hyukjun Yang},
journal= {arXiv preprint arXiv:2601.18840},
year = {2026}
}