中文

Actor-Critic 在奖励演化情况下的有限时间收敛性分析

机器学习 2025-10-15 v1 人工智能

摘要

许多流行的实用强化学习 (RL) 算法都采用演化奖励函数——通过奖励塑形、熵正则化或课程学习等技术——但其理论基础仍不成熟。本文提供了在马尔可夫抽样条件下,存在演化奖励函数的单时间尺度 Actor-Critic 算法的首次有限时间收敛分析。我们考虑奖励参数在每个时间步可以变化的情况,这影响策略优化和价值估计。 在标准假设下,我们推导了 actor 和 critic 误差的非渐近界限。我们的结果表明,在奖励参数演化足够缓慢的情况下,可实现 O(1/T)O(1/\sqrt{T}) 的收敛速率,这与静态奖励的最佳已知速率一致。当奖励通过具有有界梯度的梯度规则更新且与 actor 和 critic 相同的尺度上时,保持了该速率,这为许多流行的 RL 技术提供了理论依据。作为次要贡献,我们引入了一种针对马尔可夫抽样下分布不匹配的新分析方法,通过 log2T\log^2T 的因子提高了静态奖励情况下的最佳已知速率。

关键词

引用

@article{arxiv.2510.12334,
  title  = {Finite-time Convergence Analysis of Actor-Critic with Evolving Reward},
  author = {Rui Hu and Yu Chen and Longbo Huang},
  journal= {arXiv preprint arXiv:2510.12334},
  year   = {2025}
}