中文

面向平均奖励准则的全梯度深度强化学习

系统与控制 2023-04-10 v1 机器学习 系统与控制

摘要

我们将 Avrachenkov 等人(2021)提出的、针对折扣奖励马尔可夫决策过程且可证明收敛的全梯度 DQN 算法推广至平均奖励问题。我们在神经函数逼近设定下,以全梯度 DQN 与 DQN 为基准,对广泛使用的 RVI Q-Learning 与近期提出的差分 Q-Learning 进行了实验比较。我们还将此方法推广用于学习马尔可夫 restless 多臂_bandit 的 Whittle 指数。我们观察到所提出的全梯度变体在不同任务上具有更好的收敛速率。

关键词

引用

@article{arxiv.2304.03729,
  title  = {Full Gradient Deep Reinforcement Learning for Average-Reward Criterion},
  author = {Tejas Pagare and Vivek Borkar and Konstantin Avrachenkov},
  journal= {arXiv preprint arXiv:2304.03729},
  year   = {2023}
}

备注

13 pages, 4 figures; Accepted by 5th Annual Learning for Dynamics & Control Conference (L4DC) 2023