中文

基于自监督轨迹对比学习改进上下文元强化学习

机器学习 2021-03-12 v1 人工智能

摘要

元强化学习通常比单任务强化学习方法需要数量级更多的样本。这是因为元训练需要处理更多样化的分布并训练额外的组件(如上下文编码器)。为此,我们提出一种新型自监督学习任务,命名为轨迹对比学习(Trajectory Contrastive Learning, TCL),以改进元训练。TCL 采用对比学习,训练上下文编码器预测两个转移窗口是否采样自同一轨迹。TCL 利用基于上下文的元强化学习(meta-RL)的自然层次结构并作出极小假设,使其可普遍适用于基于上下文的元 RL 算法。它加速了上下文编码器的训练并整体改进了元训练。实验表明,在元 RL MuJoCo(6 个中的 5 个)和 Meta-World 基准(50 个中的 44 个)的大多数环境中,TCL 表现优于或可与强元 RL 基线相媲美。

关键词

引用

@article{arxiv.2103.06386,
  title  = {Improving Context-Based Meta-Reinforcement Learning with Self-Supervised Trajectory Contrastive Learning},
  author = {Bernie Wang and Simon Xu and Kurt Keutzer and Yang Gao and Bichen Wu},
  journal= {arXiv preprint arXiv:2103.06386},
  year   = {2021}
}