中文

离线基于模型的强化学习中的可达边缘问题

机器学习 2024-12-03 v2 人工智能

摘要

离线强化学习旨在从预先收集的数据集中训练智能体。然而,这带来了评估数据集中未覆盖行为价值的额外挑战。基于模型的方法提供了一种潜在的解决方案,即训练一个近似动力学模型,然后通过在该模型中进行 rollout 来收集额外的合成数据。主流理论将此方法视为在近似动力学模型中的在线强化学习,因此任何剩余的性能差距都被归因于动力学模型误差。在本文中,我们分析了这一假设,并研究了随着学习到的动力学模型得到改进,流行算法的表现如何。与直觉和理论相反,如果将学习到的动力学模型替换为真实的无误差动力学,现有的基于模型的方法会完全失效。这揭示了一个关键的疏忽:理论基础假设在学习到的动力学模型中对全视野 rollout 进行采样;然而在实践中,为了防止误差累积,模型 rollout 的步数被大幅减少。我们表明,这种 rollout 的截断导致了一组可达边缘状态,在这些状态下我们实际上是在“从虚空中自举”。这触发了病态的价值高估和完全的性能崩溃。我们将此称为可达边缘问题。基于这一新见解,我们填补了现有理论中的重要空白,并揭示了先前的基于模型的方法主要是在解决可达边缘问题,而非其所声称的模型不准确性。最后,我们提出了感知可达的价值学习 (RAVL),这是一种简单且稳健的方法,直接解决了可达边缘问题,因此—— unlike 现有方法——不会随着动力学模型的改进而失效。代码已开源:github.com/anyasims/edge-of-reach。

关键词

引用

@article{arxiv.2402.12527,
  title  = {The Edge-of-Reach Problem in Offline Model-Based Reinforcement Learning},
  author = {Anya Sims and Cong Lu and Jakob Foerster and Yee Whye Teh},
  journal= {arXiv preprint arXiv:2402.12527},
  year   = {2024}
}

备注

Code open-sourced at: https://github.com/anyasims/edge-of-reach