中文

基于模型的强化学习中“懒惰”的长处:统一目标与算法

机器学习 2023-03-02 v1 机器人学 系统与控制 系统与控制

摘要

我们提出一种新方法,以解决基于模型的强化学习(MBRL)中的两个基本挑战:在所学模型中反复寻找良好策略的计算开销,以及模型拟合与策略计算之间的目标失配。我们的“懒惰”方法利用一种新颖的统一目标——模型中经由优势的性能差异(Performance Difference via Advantage in Model),来刻画真实动态下所学策略与专家策略之间的性能差异。该目标表明,在探索分布下优化所学模型中的期望策略优势即足以进行策略计算,相较于传统规划方法带来了计算效率的显著提升。此外,该统一目标使用价值矩匹配项进行模型拟合,其与策略计算期间模型的使用方式一致。我们提出两种无遗憾算法来优化所提目标,并通过模拟基准展示它们相较于现有 MBRL 方法的统计与计算收益。

关键词

引用

@article{arxiv.2303.00694,
  title  = {The Virtues of Laziness in Model-based RL: A Unified Objective and Algorithms},
  author = {Anirudh Vemula and Yuda Song and Aarti Singh and J. Andrew Bagnell and Sanjiban Choudhury},
  journal= {arXiv preprint arXiv:2303.00694},
  year   = {2023}
}