Actor-Critic 在奖励演化情况下的有限时间收敛性分析
机器学习
2025-10-15 v1 人工智能
摘要
许多流行的实用强化学习 (RL) 算法都采用演化奖励函数——通过奖励塑形、熵正则化或课程学习等技术——但其理论基础仍不成熟。本文提供了在马尔可夫抽样条件下,存在演化奖励函数的单时间尺度 Actor-Critic 算法的首次有限时间收敛分析。我们考虑奖励参数在每个时间步可以变化的情况,这影响策略优化和价值估计。 在标准假设下,我们推导了 actor 和 critic 误差的非渐近界限。我们的结果表明,在奖励参数演化足够缓慢的情况下,可实现 的收敛速率,这与静态奖励的最佳已知速率一致。当奖励通过具有有界梯度的梯度规则更新且与 actor 和 critic 相同的尺度上时,保持了该速率,这为许多流行的 RL 技术提供了理论依据。作为次要贡献,我们引入了一种针对马尔可夫抽样下分布不匹配的新分析方法,通过 的因子提高了静态奖励情况下的最佳已知速率。
关键词
引用
@article{arxiv.2510.12334,
title = {Finite-time Convergence Analysis of Actor-Critic with Evolving Reward},
author = {Rui Hu and Yu Chen and Longbo Huang},
journal= {arXiv preprint arXiv:2510.12334},
year = {2025}
}