超越 Bellman 递归:基于 Pontryagin 原理的非指数折扣框架
机器学习
2026-05-21 v1 最优化与控制
摘要
大多数基于价值的强化学习方法和 actor-critic 方法依赖 Bellman 式递归,但这些递归在人类偏好和生存过程常见的非指数折扣下会失效。我们指出,结构性崩溃:指数折扣恰好位于乘性与时间均匀性的脆弱交汇点,违反其中任何属性都会导致标准动态规划失效。为克服这一问题,我们提出基于 Pontryagin 最大原理的直接策略优化(Pontryagin-Guided Direct Policy Optimization, PG-DPO),这是一种变分框架,摒弃递归,将 Pontryagin 最大原理与蒙特卡洛 rollout 通过 Adjoint-MC 投影相结合,以实现点态哈密顿量最大化。在多维超几何折扣和生存折扣基准上,PG-DPO 在方程驱动求解器和基于评论家的方法出现 divergence 时实现了更好的准确性和稳定性。
关键词
引用
@article{arxiv.2605.20996,
title = {Beyond the Bellman Recursion: A Pontryagin-Guided Framework for Non-Exponential Discounting},
author = {Hojin Ko and Jeonggyu Huh},
journal= {arXiv preprint arXiv:2605.20996},
year = {2026}
}