中文

基于价值梯度加权的模型强化学习

机器学习 2023-06-22 v2 人工智能

摘要

基于模型的强化学习(MBRL)是一种样本高效的控制策略获取技术,然而不可避免的建模误差常导致性能退化。MBRL中的模型通常仅拟合以重建动力学,尤其是状态观测,而模型误差对策略的影响未被训练目标所捕获。这导致MBRL的预期目标(实现良好的策略与价值学习)与实际采用的损失函数目标(未来状态预测)之间的不匹配。朴素直觉认为价值感知的模型学习可解决此问题,并且确实已有若干基于理论分析针对该目标不匹配问题的方案被提出。然而,它们在实践中往往劣于常用的基于最大似然(MLE)的方法。本文提出价值梯度加权模型学习(VaGraM),一种新颖的价值感知模型学习方法,可在小模型容量和存在干扰状态维度等挑战性设定下提升MBRL性能。我们分析MLE与价值感知两类方法,揭示它们在价值感知模型学习中如何未能考虑探索与函数近似的行为,并指出在深度学习设定下稳定优化所需满足的额外目标。我们通过在Mujoco基准套件上以比基于最大似然方法更强鲁棒性实现高回报,验证了我们的分析。

关键词

引用

@article{arxiv.2204.01464,
  title  = {Value Gradient weighted Model-Based Reinforcement Learning},
  author = {Claas Voelcker and Victor Liao and Animesh Garg and Amir-massoud Farahmand},
  journal= {arXiv preprint arXiv:2204.01464},
  year   = {2023}
}