中文

重新审视基于模型的值扩展

机器学习 2022-03-29 v1

摘要

基于模型的值扩展方法有望改善值函数目标的质量,从而提升值函数学习的有效性。然而,迄今为止,这些方法在性能上被具有概念上更简单的1步值函数目标的Dyna式算法所超越。这表明在实践中,值扩展的理论依据似乎并不成立。我们提供了一项详尽的实证研究,以阐明值扩展方法在实践中的失败原因,这被认为是复合模型误差。通过利用基于GPU的物理模拟器,我们能够在基于模型的强化学习循环内高效地使用真实动力学进行分析。在真实动力学与学习动力学之间进行的广泛比较,为这一黑箱提供了洞见。本文增进了对值扩展中实际问题的理解。我们通过实证检验当前方法的最大理论性能,提供了未来的研究方向。

关键词

引用

@article{arxiv.2203.14660,
  title  = {Revisiting Model-based Value Expansion},
  author = {Daniel Palenicek and Michael Lutter and Jan Peters},
  journal= {arXiv preprint arXiv:2203.14660},
  year   = {2022}
}