中文

超越期望值:强化学习中基于几何平均长期政策性能的优化

机器学习 2025-09-01 v1 系统与控制 系统与控制

摘要

强化学习(RL)算法通常优化累积奖励的期望值,即智能体在轨迹过程中接收的标量奖励总和的期望。期望值在无限多个轨迹上进行平均。然而,在实际部署智能体时,这种ensemble平均对单个轨迹的性能可能并不提供有用信息。因此,在许多应用中,优化单个轨迹的长期性能可能更为理想。在本文中,我们提出了一种新颖的 RL 算法,将标准的ensemble平均与时间平均增长率相结合,后者是单个轨迹长期性能的度量。我们首先定义时间平均增长率的贝尔曼算子。我们随后表明,在乘法奖励动力学下,几何平均值与时间平均增长率一致。为处理更一般且未知的奖励动力学,我们提出了一种带 NN 滑动窗口的修改版几何平均,以捕捉轨迹依赖性作为时间平均增长率的估计器。这种估计器嵌入到目标函数中,形成一种实用算法,使政策能够从ensemble平均与时间平均中同时获益。我们在具有挑战性的模拟器中评估了该算法,其中它超越了常规 RL 方法。

关键词

引用

@article{arxiv.2508.21443,
  title  = {Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning},
  author = {Xinyi Sheng and Dominik Baumann},
  journal= {arXiv preprint arXiv:2508.21443},
  year   = {2025}
}

备注

Accepted final version to appear in the Proceedings of the IEEE Conference on Decision and Control