基于高斯任务上下文与技能的解耦元强化学习
机器学习
2023-12-12 v1
摘要
离线元强化学习方法能够利用先验经验适应未见过的目标任务,在机器人控制任务中至关重要。当前方法通常利用任务上下文和技能作为先验经验,其中任务上下文与每个任务内的信息相关,而技能代表一组用于解决子任务的时序扩展动作。然而,这些方法在适应未见过的目标任务时仍表现不佳,主要原因是学习到的先验经验缺乏泛化性,即它们无法通过对连续潜在空间的探索和学习从元训练任务中提取有效的先验经验。我们提出一个名为解耦元强化学习(DCMRL)的框架,该框架(1)通过拉近同一任务内相似的任务上下文并推远不同任务的不同任务上下文,对比性地约束任务上下文的学习;(2)利用高斯量化变分自编码器(GQ-VAE)分别对任务上下文和技能的高斯分布进行聚类,并解耦其空间的探索与学习过程。这些聚类中心作为任务上下文和技能的代表性离散分布,分别存储在任务上下文码本和技能码本中。DCMRL能够获取可泛化的先验经验,并在元测试阶段实现对未见过的目标任务的有效适应。在导航和机器人操作连续控制任务中的实验表明,DCMRL比以往的元强化学习方法更有效,且具有更强的先验经验泛化性。
引用
@article{arxiv.2312.06518,
title = {Decoupling Meta-Reinforcement Learning with Gaussian Task Contexts and Skills},
author = {Hongcai He and Anjie Zhu and Shuang Liang and Feiyu Chen and Jie Shao},
journal= {arXiv preprint arXiv:2312.06518},
year = {2023}
}
备注
Accepted by AAAI 2024 (this version includes appendix)