用于平均奖励MDP且带函数逼近的双时间尺度Critic-Actor算法
机器学习
2025-09-01 v4
摘要
近期一些工作专注于对AC算法进行非渐近收敛性分析。最近,在表格型案例的折扣代价设定中,提出了一种双时间尺度Critic-Actor算法,其中Actor和Critic的时间尺度是相反的,但仅展示了渐近收敛性。在我们的工作中,我们首次在长期平均奖励设定下提出了带函数逼近的双时间尺度Critic-Actor算法,并首次对此类方案进行了有限时间非渐近及渐近收敛分析。我们获得了最优学习率,并证明我们的算法在Critic的均方误差上界为 时,实现了 的样本复杂度(其中 可任意接近零),这优于在类似设置下为双时间尺度AC算法获得的结果。我们分析的一个显著特点是,除了获得的有限时间界之外,我们还展示了该方案的渐近收敛分析,并证明了(较慢的)Critic递归几乎必然渐近收敛到相关微分包含的吸引子,其中Actor参数对应于扰动平均奖励目标的局部最大值。我们还展示了在三个基准设置上的数值实验结果,并观察到我们的Critic-Actor算法在所有算法中表现最佳。
引用
@article{arxiv.2402.01371,
title = {Two-Timescale Critic-Actor for Average Reward MDPs with Function Approximation},
author = {Prashansa Panda and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:2402.01371},
year = {2025}
}