中文

偷走那份便餐:揭示 Dyna 式强化学习的局限性

机器学习 2025-06-24 v3

摘要

Dyna 式基于模型的强化学习(DMBRL)算法是一系列用于生成合成状态转换数据,从而增强基于策略的 RL 算法样本效率的技术。本文识别并研究了在基于关节感知观测的不同基准环境中应用 DMBRL 算法时出现的意外性能差距。我们表明,尽管 DMBRL 算法在 OpenAI Gym 中表现良好,但在 DeepMind 控制套件(DMC)中的性能可能显著下降,尽管这些设置提供了相似的任务和相同的物理后端。现代技术旨在解决这些设置中出现的几个关键问题,但并未在所有环境中提供一致的改进。总体而言,我们的结果表明,将合成滚动加入训练过程——即 Dyna 式算法的核心——在大多数 DMC 环境中显著降低了性能。我们的发现促进了对模型基学习中几个根本性挑战的更深入理解,表明像许多优化领域一样,在 RL 中跨越多样化基准评估性能时,并不存在免费午餐。

关键词

引用

@article{arxiv.2412.14312,
  title  = {Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning},
  author = {Brett Barkley and David Fridovich-Keil},
  journal= {arXiv preprint arXiv:2412.14312},
  year   = {2025}
}

备注

Accepted to ICML 2025