AdaGamma:用于强化学习时间自适应的状态相关折扣
机器学习
2026-05-08 v1 人工智能
摘要
强化学习中的折扣因子同时控制有效规划视野和自举强度,然而大多数深度强化学习方法在所有状态上使用单一固定值。尽管状态相关折扣在概念上具有吸引力,但朴素的深度 actor--critic 实现可能会变得不稳定并退化至 TD 误差坍缩。我们提出了 AdaGamma,一种用于状态相关折扣的实用深度 actor--critic 方法,该方法学习一个状态相关折扣函数,并结合回报一致性目标来正则化诱导的备份结构。在理论方面,我们分析了由状态相关折扣诱导的 Bellman 算子,并建立了其在适当条件下的基本适定性。在实验上,AdaGamma 集成到 SAC 和 PPO 中,在连续控制基准上产生了一致的改进,并在京东物流平台的在线 A/B 测试中取得了统计上显著的收益。这些结果表明,当与防止退化目标操纵的回报一致性目标相结合时,状态相关折扣在深度强化学习中可以变得有效。
引用
@article{arxiv.2605.06149,
title = {AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning},
author = {Yaomin Wang and Jianting Pan and Ran Tian and Xiaoyang Li and Yu Zhang and Hengle Qin and Tianshu YU},
journal= {arXiv preprint arXiv:2605.06149},
year = {2026}
}
备注
22 pages, 9 figures