中文

指数效用强化学习:算法与折扣 MDP 中的收敛性

机器学习 2026-05-11 v1

摘要

针对折扣马尔可夫决策过程 (MDP) 中的指数效用强化学习 (RL),目前缺乏系统性价值基方法。我们在固定风险规避设定下填补这一空白。基于文献 \cite{porteus1975optimality} 中研究的指数效用的 Bellman 型方程,我们推导出两种 Q 值风格的扩展,并证明其关联算子在 LL_\infty 和 sup-log/Thompson 度量中分别为压缩映射。我们刻画了其固定点,并证明诱导的贪心 stationary 策略在指数效用目标下对所有 stationary 策略均为最优。这些结构结果导致两个模型无关算法:一种基于两时间尺度的 Q 学习风格算法,我们建立了几乎sure收敛性,并通过时间尺度分离提供了有限时间收敛率;另一种由次线性幂律算子控制的时间尺度算法。由于后者在标准度量下不具备全局压缩性,我们基于局部 Lipschitz 性、单调性、齐次性和 Dini 导数进行细致论证,给出标量有限时间分析,凸显了在向量情形下获取收敛率的挑战。我们的工作为指数效用目标下的价值基强化学习奠定了基础。

关键词

引用

@article{arxiv.2605.08053,
  title  = {Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs},
  author = {Gugan Thoppe and L. A. Prashanth and Ankur Naskar and Sanjay Bhat},
  journal= {arXiv preprint arXiv:2605.08053},
  year   = {2026}
}