价值扩展方法的递减回报
机器学习
2024-12-31 v1
摘要
基于模型的强化学习旨在提高样本效率,但动力学模型的精度和由此产生的复合误差常被视为关键限制。本文实证研究了在基于模型的价值扩展方法中,改进动力学模型带来的潜在样本效率提升。我们的研究揭示了两个关键发现:首先,更长的展开视野提高了样本效率,但每增加一个扩展步骤,改进迅速递减。其次,与具有相同视野的学习模型相比,提高模型精度仅略微提高样本效率。与无模型价值扩展方法相比,这种样本效率的递减尤为显著。这些无模型算法在没有计算开销的情况下实现了可比的性能。我们的结果表明,基于模型的价值扩展方法的局限性不能归因于模型精度。尽管更高的精度是有益的,但即使完美的模型也不能提供无与伦比的样本效率。因此,瓶颈存在于别处。这些结果挑战了模型精度是基于模型强化学习主要约束的常见假设。
引用
@article{arxiv.2412.20537,
title = {Diminishing Return of Value Expansion Methods},
author = {Daniel Palenicek and Michael Lutter and João Carvalho and Daniel Dennert and Faran Ahmad and Jan Peters},
journal= {arXiv preprint arXiv:2412.20537},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2303.03955