中文

模型、像素与奖励:基于视觉模型的强化学习中的设计权衡评估

机器学习 2020-12-09 v1

摘要

基于模型的强化学习(MBRL)方法已在多种任务中展现出强大的样本效率与性能,包括面对高维视觉观测时。这些方法从交互中学习预测环境动态与期望奖励,并利用该预测模型进行规划与执行任务。然而,MBRL 方法在其基本设计选择上存在差异,且文献中对于这些设计决策如何影响性能尚无强烈共识。本文中,我们研究了视觉 MBRL 算法中预测模型的若干设计决策,特别关注使用预测模型进行规划的方法。我们发现,许多常被认为至关重要的设计决策(如潜在空间的使用)对任务性能影响甚微。这一发现的一大例外是,与仅预测奖励相比,预测未来观测(即图像)带来了显著的任务性能提升。我们还从经验上发现,图像预测精度(有些令人惊讶地)与下游任务性能的相关性比奖励预测精度更强。我们展示了这一现象如何与探索相关,以及为何在标准基准(需要探索)上得分较低的一些模型在相同的训练数据上训练时会与性能最佳的模型表现一致。同时,在缺乏探索的情况下,对数据拟合更好的模型通常也在下游任务上表现更好,但令人惊讶的是,这些往往并非从零开始学习与探索时表现最好的模型。这些发现表明,性能与探索对模型提出了重要且可能相互矛盾的要求。

关键词

引用

@article{arxiv.2012.04603,
  title  = {Models, Pixels, and Rewards: Evaluating Design Trade-offs in Visual Model-Based Reinforcement Learning},
  author = {Mohammad Babaeizadeh and Mohammad Taghi Saffar and Danijar Hafner and Harini Kannan and Chelsea Finn and Sergey Levine and Dumitru Erhan},
  journal= {arXiv preprint arXiv:2012.04603},
  year   = {2020}
}