面向平均奖励准则的全梯度深度强化学习
系统与控制
2023-04-10 v1 机器学习
系统与控制
摘要
我们将 Avrachenkov 等人(2021)提出的、针对折扣奖励马尔可夫决策过程且可证明收敛的全梯度 DQN 算法推广至平均奖励问题。我们在神经函数逼近设定下,以全梯度 DQN 与 DQN 为基准,对广泛使用的 RVI Q-Learning 与近期提出的差分 Q-Learning 进行了实验比较。我们还将此方法推广用于学习马尔可夫 restless 多臂_bandit 的 Whittle 指数。我们观察到所提出的全梯度变体在不同任务上具有更好的收敛速率。
引用
@article{arxiv.2304.03729,
title = {Full Gradient Deep Reinforcement Learning for Average-Reward Criterion},
author = {Tejas Pagare and Vivek Borkar and Konstantin Avrachenkov},
journal= {arXiv preprint arXiv:2304.03729},
year = {2023}
}
备注
13 pages, 4 figures; Accepted by 5th Annual Learning for Dynamics & Control Conference (L4DC) 2023