中文

分析与桥接深度强化学习中总回报与折扣回报的差距

机器学习 2025-03-19 v2

摘要

强化学习(RL)中的最优目标是基本性问题,决定了策略如何被评估和优化。虽然总回报最大化是RL中的理想目标,但折扣回报最大化因其稳定性成为实用目标。这可能导致目标错位。为更好地理解此问题,我们理论上分析了政策最大化总回报与政策最大化折扣回报之间的性能差距。我们的分析表明,当环境包含循环状态时(这属于常见情形),增加折扣因子可能无效地消除这一差距。为此,我们提出两种替代方法来实现目标一致性。第一种方法通过修改终端状态价值实现一致性,将其视为具有通过理论分析定义的合适范围的可调超参数。第二种方法侧重于校准轨迹中的奖励数据,使使用基于离策略算法的实际深度RL应用能够实现一致性。该方法提高了对折扣因子的鲁棒性,并在轨迹长度较大时提升性能。我们的方法表明,调整奖励数据可实现一致性,为设计新的优化目标以从根本上增强RL算法性能提供了见解。

关键词

引用

@article{arxiv.2407.13279,
  title  = {Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning},
  author = {Shuyu Yin and Fei Wen and Peilin Liu and Tao Luo},
  journal= {arXiv preprint arXiv:2407.13279},
  year   = {2025}
}