基于确定性策略搜索的离策略平均奖励 actor-critic
机器学习
2023-07-20 v2 人工智能
摘要
由于强化学习文献中大多数现有工作考虑折扣奖励准则,平均奖励准则的研究相对较少。近期少数工作提出了同策略平均奖励 actor-critic 算法,但平均奖励离策略 actor-critic 相对较少被探索。本工作中,我们针对平均奖励性能准则给出了同策略和离策略的确定性策略梯度定理。利用这些定理,我们还提出了一种平均奖励离策略深度确定性策略梯度(ARO-DDPG)算法。我们首先使用基于 ODE 的方法给出渐近收敛分析。随后,我们对所得随机逼近方案在线性函数逼近下给出有限时间分析,并以 的样本复杂度获得 -最优平稳策略。我们比较了所提 ARO-DDPG 算法的平均奖励性能,并观察到在基于 MuJoCo 的环境中相较于最先进的同策略平均奖励 actor-critic 算法具有更好的经验性能。
引用
@article{arxiv.2305.12239,
title = {Off-Policy Average Reward Actor-Critic with Deterministic Policy Search},
author = {Naman Saxena and Subhojyoti Khastigir and Shishir Kolathaya and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:2305.12239},
year = {2023}
}
备注
Accepted at ICML 2023