简化深度时序差分学习
机器学习
2025-04-23 v6
摘要
Q学习在强化学习(RL)领域发挥了基础性作用。然而,使用离策略数据的TD算法(如Q学习)或使用深度神经网络等非线性函数逼近需要额外的技巧来稳定训练,主要是大型经验回放缓冲区和目标网络。不幸的是,目标网络中冻结网络参数的延迟更新损害了样本效率,同样,大型经验回放缓冲区引入了内存和实现开销。在本文中,我们研究了是否有可能在保持稳定性的同时加速和简化离策略TD训练。我们的关键理论结果首次证明,诸如LayerNorm之类的正则化技术可以产生可证明收敛的TD算法,而无需目标网络或经验回放缓冲区,即使使用离策略数据也是如此。实验上,我们发现由向量化环境实现的在线并行采样可以在不需要大型经验回放缓冲区的情况下稳定训练。受这些发现的启发,我们提出了PQN,即我们简化的深度在线Q学习算法。令人惊讶的是,这个简单的算法与更复杂的方法(如Atari中的Rainbow、Craftax中的PPO-RNN、Smax中的QMix)具有竞争力,并且在不牺牲样本效率的情况下,可以比传统DQN快多达50倍。在PPO已成为首选RL算法的时代,PQN重新确立了离策略Q学习作为一种可行的替代方案。
引用
@article{arxiv.2407.04811,
title = {Simplifying Deep Temporal Difference Learning},
author = {Matteo Gallici and Mattie Fellows and Benjamin Ellis and Bartomeu Pou and Ivan Masmitja and Jakob Nicolaus Foerster and Mario Martin},
journal= {arXiv preprint arXiv:2407.04811},
year = {2025}
}