中文

基于模型的强化学习中值展开方法收益递减

机器学习 2023-03-08 v1

摘要

基于模型的强化学习是提高样本效率的一种途径。然而,动力学模型的准确性及在建模轨迹上由此产生的复合误差通常被视为关键局限。一个自然的问题是:通过改进所学动力学模型还能获得多少样本效率?本文针对连续控制问题中基于模型的值展开方法类,以实证方式回答该问题。值展开方法应受益于模型准确性的提升,从而实现更长的展开步长与更优的值函数近似。我们利用预言机动力学模型以避免复合模型误差的实证研究显示:(1)更长步长提升样本效率,但每额外一步带来的改进增益递减;(2)相较于相同步长的所学模型,模型准确性的提高仅边际提升样本效率。因此,更长步长与更高模型准确性在样本效率上收益递减。与无模型值展开方法相比,这些样本效率改进尤为令人失望。尽管无模型方法不引入计算开销,我们发现其性能与基于模型的值展开方法相当。因此,我们得出结论:基于模型的值展开方法的局限并非所学模型的模型准确性。虽然更高模型准确性有益,但实验表明即便完美模型也无法提供无双的样本效率,瓶颈另有所在。

关键词

引用

@article{arxiv.2303.03955,
  title  = {Diminishing Return of Value Expansion Methods in Model-Based Reinforcement Learning},
  author = {Daniel Palenicek and Michael Lutter and Joao Carvalho and Jan Peters},
  journal= {arXiv preprint arXiv:2303.03955},
  year   = {2023}
}

备注

Published as a conference paper at ICLR 2023