宽泛非参数环境中的元强化学习
机器学习
2022-03-23 v2 人工智能
摘要
近期最先进的人工智能体缺乏快速适应新任务的能力,因为它们仅针对特定目标训练,且需要大量交互来学习新技能。元强化学习(meta-RL)通过利用从训练任务中学到的知识在先前未见的任务中表现良好,来解决这一挑战。然而,当前的 meta-RL 方法将自己局限于狭窄的参数化任务分布,忽略了真实世界中任务间存在的质性差异。在本文中,我们介绍 TIGR,一种基于任务推断的 meta-RL 算法,使用高斯混合模型(GMM)与门控循环单元,专为非参数环境中的任务设计。我们采用涉及 GMM 的生成模型来捕获任务的多模态性。我们将策略训练与任务推断学习解耦,并基于无监督重构目标高效训练推断机制。我们提供了基于 half-cheetah 环境的具有质性差异任务的基准,并展示了 TIGR 在样本效率(快 3-10 倍)、渐近性能以及非参数环境中零样本适应的适用性方面相较最先进 meta-RL 方法的优越性能。
引用
@article{arxiv.2108.03718,
title = {Meta-Reinforcement Learning in Broad and Non-Parametric Environments},
author = {Zhenshan Bing and Lukas Knak and Fabrice Oliver Robin and Kai Huang and Alois Knoll},
journal= {arXiv preprint arXiv:2108.03718},
year = {2022}
}