NFQ2.0:CartPole 基准的再访
机器学习
2025-11-18 v1
摘要
本文重访了在其经典 CartPole 基准上运行的 20 年-old 神经拟合 Q 迭代(NFQ)算法。NFQ 是现代深度强化学习(Deep RL)的开创性方法之一,旨在将多层神经网络应用于强化学习以解决实际控制问题。我们探讨了算法的概念简单性以及从在线学习向 batch 学习的过渡,这对其稳定性有所贡献。尽管最初取得了成功,NFQ 需要 extensive 调优,在实际控制问题中难以复现。我们提出了现代化的变体 NFQ2.0,并将其应用于 CartPole 任务,聚焦于由标准工业组件构建的真实系统,以调查和改进学习过程的可重复性和鲁棒性。通过消融研究,我们强调了哪些关键设计决策和超参数能够显著提升 NFQ2.0 在稳定性和性能方面的表现。最后,我们展示了我们的发现如何帮助实践者复现和改进结果,并更有效地在工业背景下应用深度强化学习。
引用
@article{arxiv.2511.12644,
title = {NFQ2.0: The CartPole Benchmark Revisited},
author = {Sascha Lange and Roland Hafner and Martin Riedmiller},
journal= {arXiv preprint arXiv:2511.12644},
year = {2025}
}