中文

基于加权 Lp 范数的软 Bellman 剩余最小化的收缩对齐分析

机器学习 2026-04-09 v1

摘要

在函数逼近下求解马尔可夫决策过程的问题,始终是一 fundamental 挑战,即便在线性函数逼近的情形下也是如此。一个关键难点在于几何不匹配:虽然 Bellman 最优算子在 L∞ 范数下是收缩的,但常见的目标如投影值迭代和 Bellman 剩余最小化依赖于 L2 形式的表述。为实现梯度-based 优化,我们考虑 Bellman 剩余最小化的软化形式,并将其扩展为加权 Lp 范数。我们证明,该表述随着 p 的增大,将优化目标与 Bellman 算子收缩几何对齐,并推导出相应的性能误差界限。我们的分析为 Bellman 收缩与剩余最小化之间提供了原则性的联系,leading to improved control of error propagation while remaining compatible with gradient-based optimization。

关键词

引用

@article{arxiv.2604.06837,
  title  = {Contraction-Aligned Analysis of Soft Bellman Residual Minimization with Weighted Lp-Norm for Markov Decision Problem},
  author = {Hyukjun Yang and Han-Dong Lim and Donghwan Lee},
  journal= {arXiv preprint arXiv:2604.06837},
  year   = {2026}
}