增强世界模型助力单一离线环境下的零样本动力学泛化
机器学习
2021-08-04 v3 人工智能
摘要
从大规模离线数据集进行强化学习使我们能够在潜在不安全或不切实际的探索之外学习策略。过去几年中,在纠正数据收集与所学策略之间行为差异这一挑战上已取得显著进展。然而,很少有关注在将策略迁移到在线设置时潜在变化的动力学,现有方法的性能可能因此降低多达 90%。在本文中,我们用增强世界模型(AugWM)解决此问题。我们用寻求捕捉机器人物理属性潜在变化的简单变换来增强所学的动力学模型,从而得到更鲁棒的策略。我们不仅在新设置中训练策略,还为其提供采样增强作为上下文,使其能适应环境变化。在测试时,我们以自监督方式通过学习对应于新环境的增强来近似该上下文。我们在超过 100 种不同变化动力学设置上严格评估了我们的方法,并表明这种简单方法能显著改善近期最先进基线的零样本泛化,常在基线失败处获得成功策略。
引用
@article{arxiv.2104.05632,
title = {Augmented World Models Facilitate Zero-Shot Dynamics Generalization From a Single Offline Environment},
author = {Philip J. Ball and Cong Lu and Jack Parker-Holder and Stephen Roberts},
journal= {arXiv preprint arXiv:2104.05632},
year = {2021}
}
备注
Accepted @ ICML 2021; Spotlight @ ICLR 2021 "Self-Supervision for Reinforcement Learning Workshop"