中文

剖析高更新比率下的深度强化学习:对抗价值发散

机器学习 2024-08-06 v3 人工智能

摘要

我们表明,通过对抗价值函数发散,深度强化学习算法可以在梯度更新次数远超环境样本数的设置中,无需重置网络参数即可保持学习能力。在大更新与数据比率下,Nikishin 等人 (2022) 最近的一项研究指出出现了首要性偏差 (primacy bias),即智能体过度拟合早期交互而忽视后期经验,从而损害其学习能力。在这项工作中,我们研究了导致首要性偏差的现象。我们检查了被推测导致学习失败的训练早期阶段,发现一个根本性的挑战是一个长期存在的问题:价值函数发散。我们发现 Q 值过高不仅出现在分布外数据上,也出现在分布内数据上,并且可以与由优化器动量推动的未见动作预测上的高估联系起来。我们采用了一种简单的单位球归一化方法,使得在大更新比率下能够进行学习,并在广泛使用的 dm_control 套件上展示了其有效性,同时在具有挑战性的 dog 任务上获得了与基于模型的方法相媲美的强劲性能。我们的结果在部分上质疑了先前关于因过度拟合早期数据而导致次优学习的解释。

关键词

引用

@article{arxiv.2403.05996,
  title  = {Dissecting Deep RL with High Update Ratios: Combatting Value Divergence},
  author = {Marcel Hussing and Claas Voelcker and Igor Gilitschenski and Amir-massoud Farahmand and Eric Eaton},
  journal= {arXiv preprint arXiv:2403.05996},
  year   = {2024}
}

备注

Accepted as a conference paper at the First Reinforcement Learning Conference (RLC)