停止回归:通过分类训练价值函数以实现可扩展的深度强化学习
机器学习
2024-03-07 v1 人工智能
机器学习
摘要
价值函数是深度强化学习 (RL) 的核心组件。这些由神经网络参数化的函数通常使用均方误差回归目标进行训练,以匹配自举目标值。然而,将使用回归的基于价值的 RL 方法扩展到大容量网络(如高容量 Transformer)已被证明具有挑战性。这与监督学习形成鲜明对比:通过利用交叉熵分类损失,监督方法已可靠地扩展至大规模网络。观察到这一差异,本文研究了是否仅通过将回归替换为分类来训练价值函数,就能提高深度 RL 的可扩展性。我们证明,使用分类交叉熵训练的价值函数在多种领域显著提高了性能和可扩展性。这些领域包括:使用 SoftMoEs 在 Atari 2600 游戏上进行单任务 RL、使用大规模 ResNets 在 Atari 上进行多任务 RL、使用 Q-transformers 进行机器人操作、无搜索下棋,以及使用高容量 Transformer 进行语言代理 Wordle 任务,并在这些领域取得了最先进 (SOTA) 的结果。通过仔细分析,我们表明分类交叉熵的优势主要源于其缓解基于价值的 RL 固有问题的能力,例如噪声目标和非平稳性。总体而言,我们认为简单地转向使用分类交叉熵训练价值函数,可以以极小甚至零成本大幅提高深度 RL 的可扩展性。
引用
@article{arxiv.2403.03950,
title = {Stop Regressing: Training Value Functions via Classification for Scalable Deep RL},
author = {Jesse Farebrother and Jordi Orbay and Quan Vuong and Adrien Ali Taïga and Yevgen Chebotar and Ted Xiao and Alex Irpan and Sergey Levine and Pablo Samuel Castro and Aleksandra Faust and Aviral Kumar and Rishabh Agarwal},
journal= {arXiv preprint arXiv:2403.03950},
year = {2024}
}