中文

RePo:通过正则化后验可预测性实现弹性基于模型的强化学习

机器学习 2023-10-26 v2 人工智能 机器人学

摘要

视觉基于模型的强化学习(RL)方法通常以未消除冗余信息的方式将图像观测编码为低维表示。这使它们易受伪变化的干扰——任务无关成分(如背景干扰物或光照条件)的改变。本文中,我们提出一种视觉基于模型的RL方法,学习对这类伪变化具有弹性的潜表示。我们的训练目标鼓励表示对动态和奖励具有最大可预测性,同时约束从观测到潜表示的信息流。我们证明该目标显著增强了视觉基于模型的RL方法对视觉干扰物的弹性,使其能在动态环境中运行。随后我们表明,虽然学到的编码器对伪变化具有弹性,但在显著分布偏移下并非不变。为此,我们提出一种简单的无奖励对齐过程,使编码器能在测试时自适应。这允许快速适应差异巨大的环境,而无需重新学习动态和策略。我们的工作使基于模型的RL朝成为动态、多样领域的实用有用工具迈进了一步。我们在具有显著伪变化的模拟基准以及带有背景噪声电视的真实世界自我中心导航任务中展示了其有效性。视频与代码见 https://zchuning.github.io/repo-website/。

关键词

引用

@article{arxiv.2309.00082,
  title  = {RePo: Resilient Model-Based Reinforcement Learning by Regularizing Posterior Predictability},
  author = {Chuning Zhu and Max Simchowitz and Siri Gadipudi and Abhishek Gupta},
  journal= {arXiv preprint arXiv:2309.00082},
  year   = {2023}
}