中文

基于模型的强化学习中的目标失配

机器学习 2021-04-20 v3 机器人学 机器学习

摘要

基于模型的强化学习(MBRL)已被证明是一种能高效学习连续任务控制的强大框架。近期 MBRL 的工作多聚焦于使用更先进的函近似器与规划方案,而对通用框架的发展甚少。本文指出了标准 MBRL 框架的一个基本问题——我们称之为目标失配(objective mismatch)问题。当一个目标被优化,却期望第二个通常无关的指标也得到优化时,便产生目标失配。在 MBRL 背景下,我们刻画了训练前向动力学模型时针对单步前向预测似然的目标,与改善下游控制任务性能这一总体目标之间的目标失配。例如,该问题可能在以下认识下出现:对特定任务有效的动力学模型未必需要全局精确,反之全局精确的模型在特定任务上可能局部精度不足以致控制性能不佳。在我们的实验中,我们研究该目标失配问题,并证明单步前向预测的似然并不总是与控制性能相关。这一观察凸显了 MBRL 框架的关键局限,需进一步研究以充分理解与解决。我们提出一种通过重新加权动力学模型训练来缓解失配问题的初步方法。在此基础上,我们讨论了解决该问题的其他潜在研究方向。

关键词

引用

@article{arxiv.2002.04523,
  title  = {Objective Mismatch in Model-based Reinforcement Learning},
  author = {Nathan Lambert and Brandon Amos and Omry Yadan and Roberto Calandra},
  journal= {arXiv preprint arXiv:2002.04523},
  year   = {2021}
}

备注

9 pages, 2 pages references, 5 pages appendices