中文

Q学习是否是 poorly posed 问题?

机器学习 2025-02-24 v2 人工智能

摘要

本文探讨了Q学习在连续环境中的不稳定性,这是实践者常遇到的挑战。传统上,这种不稳定性归因于自举误差和回归模型误差。我们采用代表性的强化学习基准进行系统性检验,通过逐步消除这些潜在误差来源来考察自举和模型不准确的影响。我们的发现表明,即便在相对简单的基准中,Q学习的根本任务——从基于策略的目标值中迭代学习Q函数——可能是内在不适定且容易失败的。这些见解对Q学习作为通用强化学习解决方案的可靠性提出了质疑。

关键词

引用

@article{arxiv.2502.14365,
  title  = {Is Q-learning an Ill-posed Problem?},
  author = {Philipp Wissmann and Daniel Hein and Steffen Udluft and Thomas Runkler},
  journal= {arXiv preprint arXiv:2502.14365},
  year   = {2025}
}

备注

Accepted at ESANN 2025