深入审视 Actor-Critic 算法中的折扣失配
机器学习
2022-01-27 v4 人工智能
摘要
我们从表示学习的视角考察 actor-critic 算法实现中的折扣失配。理论上,actor-critic 算法通常对 actor 与 critic 均进行折扣,即对于轨迹中时刻 观测到的转移,actor 更新中存在 项,而 critic 是一个折扣价值函数。然而实践者通常忽略 actor 的折扣()而使用折扣 critic。我们在两种情景中考察该失配。在第一种情景中,我们考虑优化无折扣目标 ,其中 自然消失 。我们进而提出从偏差-方差-表示权衡的角度解释 critic 中的折扣,并给出支持的实证结果。在第二种情景中,我们考虑优化折扣目标(),并提议从辅助任务视角解释 actor 更新中折扣的省略,且给出支持的实证结果。
引用
@article{arxiv.2010.01069,
title = {A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms},
author = {Shangtong Zhang and Romain Laroche and Harm van Seijen and Shimon Whiteson and Remi Tachet des Combes},
journal= {arXiv preprint arXiv:2010.01069},
year = {2022}
}
备注
AAMAS 2022