中文

深入审视 Actor-Critic 算法中的折扣失配

机器学习 2022-01-27 v4 人工智能

摘要

我们从表示学习的视角考察 actor-critic 算法实现中的折扣失配。理论上,actor-critic 算法通常对 actor 与 critic 均进行折扣,即对于轨迹中时刻 tt 观测到的转移,actor 更新中存在 γt\gamma^t 项,而 critic 是一个折扣价值函数。然而实践者通常忽略 actor 的折扣(γt\gamma^t)而使用折扣 critic。我们在两种情景中考察该失配。在第一种情景中,我们考虑优化无折扣目标 (γ=1)(\gamma = 1),其中 γt\gamma^t 自然消失 (1t=1)(1^t = 1)。我们进而提出从偏差-方差-表示权衡的角度解释 critic 中的折扣,并给出支持的实证结果。在第二种情景中,我们考虑优化折扣目标(γ<1\gamma < 1),并提议从辅助任务视角解释 actor 更新中折扣的省略,且给出支持的实证结果。

关键词

引用

@article{arxiv.2010.01069,
  title  = {A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms},
  author = {Shangtong Zhang and Romain Laroche and Harm van Seijen and Shimon Whiteson and Remi Tachet des Combes},
  journal= {arXiv preprint arXiv:2010.01069},
  year   = {2022}
}

备注

AAMAS 2022