中文

面向基于模型的强化学习方法适应性的评估

机器学习 2022-06-28 v2 人工智能

摘要

近年来,越来越多的深度基于模型的强化学习(RL)方法被提出。对深度基于模型的 RL 的兴趣并不令人意外,鉴于其诸多潜在益处,如更高的采样效率和快速适应环境变量化的潜力。然而,我们利用近期提出的局部变化适应(LoCA)设置的改进版本证明,诸如 PlaNet 和 DreamerV2 等知名基于模型的方法在适应局部环境变化的能力上表现不佳。结合先前工作中对另一流行基于模型方法 MuZero 的类似观察,一种趋势似乎正在浮现,表明当前深度基于模型方法存在严重局限。我们深入探究此不佳表现的原因,通过识别损害自适应行为的要素并将其关联到深度基于模型 RL 中常用的底层技术。我们通过线性函数近似在经验上验证这些见解,证明改进版线性 Dyna 实现了对局部变化的有效适应。此外,我们通过实验非线性版 Dyna,提供了构建自适应非线性基于模型方法挑战的详细见解。

关键词

引用

@article{arxiv.2204.11464,
  title  = {Towards Evaluating Adaptivity of Model-Based Reinforcement Learning Methods},
  author = {Yi Wan and Ali Rahimi-Kalahroudi and Janarthanan Rajendran and Ida Momennejad and Sarath Chandar and Harm van Seijen},
  journal= {arXiv preprint arXiv:2204.11464},
  year   = {2022}
}