中文

NFQ2.0:CartPole 基准的再访

机器学习 2025-11-18 v1

摘要

本文重访了在其经典 CartPole 基准上运行的 20 年-old 神经拟合 Q 迭代(NFQ)算法。NFQ 是现代深度强化学习(Deep RL)的开创性方法之一,旨在将多层神经网络应用于强化学习以解决实际控制问题。我们探讨了算法的概念简单性以及从在线学习向 batch 学习的过渡,这对其稳定性有所贡献。尽管最初取得了成功,NFQ 需要 extensive 调优,在实际控制问题中难以复现。我们提出了现代化的变体 NFQ2.0,并将其应用于 CartPole 任务,聚焦于由标准工业组件构建的真实系统,以调查和改进学习过程的可重复性和鲁棒性。通过消融研究,我们强调了哪些关键设计决策和超参数能够显著提升 NFQ2.0 在稳定性和性能方面的表现。最后,我们展示了我们的发现如何帮助实践者复现和改进结果,并更有效地在工业背景下应用深度强化学习。

关键词

引用

@article{arxiv.2511.12644,
  title  = {NFQ2.0: The CartPole Benchmark Revisited},
  author = {Sascha Lange and Roland Hafner and Martin Riedmiller},
  journal= {arXiv preprint arXiv:2511.12644},
  year   = {2025}
}