梦想以适配:基于隐上下文想象与 MDP 想象的元强化学习
机器学习
2023-11-14 v1 人工智能
机器人学
摘要
元强化学习(Meta RL)已被充分探索,以通过迁移从相似任务中先前学到的知识来快速学习未见任务。然而,大多数最先进算法要求元训练任务在任务分布上有稠密覆盖,且每个任务需要大量数据。本文中,我们提出 MetaDreamer,一种基于上下文的 Meta RL 算法,通过元想象与 MDP 想象减少所需真实训练任务与数据。我们通过在对具有解耦属性的所学隐上下文空间上插值来进行元想象,并通过加入物理知识于普通 VAE 网络的生成式世界模型进行 MDP 想象。我们在多种基准上的实验表明,MetaDreamer 在数据效率与插值泛化上优于现有方法。
引用
@article{arxiv.2311.06673,
title = {Dream to Adapt: Meta Reinforcement Learning by Latent Context Imagination and MDP Imagination},
author = {Lu Wen and Songan Zhang and H. Eric Tseng and Huei Peng},
journal= {arXiv preprint arXiv:2311.06673},
year = {2023}
}