中文

深度强化学习中重置优化器:一项实证研究

机器学习 2023-11-16 v2 人工智能

摘要

我们关注深度强化学习中最优值函数的逼近任务。这一迭代过程由求解一系列损失函数逐次迭代变化的优化问题组成。求解该序列问题的通用方法是采用随机梯度下降算法的现代变体,如 Adam。这些优化器维护自身的内部参数(如梯度一阶矩与二阶矩的估计)并随时间更新。因此,前次迭代获得的信息被用于求解当前迭代的优化问题。我们证明,这可能会污染矩估计,因为优化地形可在相邻迭代间任意改变。为防范这一负面效应,一个简单的思路是在开始新迭代时重置优化器的内部参数。我们通过将多种优化器与 Rainbow 算法结合,对该重置思路进行了实证探究。我们表明,这一简单修改显著提升了深度 RL 在 Atari 基准上的性能。

关键词

引用

@article{arxiv.2306.17833,
  title  = {Resetting the Optimizer in Deep RL: An Empirical Study},
  author = {Kavosh Asadi and Rasool Fakoor and Shoham Sabach},
  journal= {arXiv preprint arXiv:2306.17833},
  year   = {2023}
}

备注

Accepted at Thirty-seventh Conference on Neural Information Processing Systems (NeurIPS 2023)