DreamerPro:基于原型表示的无重构模型强化学习
机器学习
2021-10-28 v1 人工智能
摘要
性能最优的基于模型的强化学习(MBRL)智能体,如 Dreamer,通过重构图像观测来学习世界模型。因此,它们往往无法丢弃与任务无关的细节,且难以处理视觉干扰。为解决此问题,已有工作提出以对比方式学习世界模型,但在无干扰情况下性能往往较差。本文旨在增强 MBRL 智能体对干扰的鲁棒性。具体而言,我们考虑引入原型表示,其在计算机视觉中已展现出比对比方法更准确且鲁棒的结果。然而,由于原型表示独立处理每幅图像而不捕捉时间结构,其如何有益于 MBRL 中的时间动态学习仍不清楚。为此,我们提出从世界模型的循环状态中学习原型,从而将过去观测与动作的时间结构蒸馏到原型中。所得模型 DreamerPro 成功将 Dreamer 与原型结合,在 DeepMind Control 套件的标准设置及存在复杂背景干扰时均取得大幅性能提升。代码见 https://github.com/fdeng18/dreamer-pro 。
引用
@article{arxiv.2110.14565,
title = {DreamerPro: Reconstruction-Free Model-Based Reinforcement Learning with Prototypical Representations},
author = {Fei Deng and Ingook Jang and Sungjin Ahn},
journal= {arXiv preprint arXiv:2110.14565},
year = {2021}
}