中文

基于渐进域适配最优传输的课程强化学习

机器学习 2022-10-20 v1 人工智能

摘要

课程强化学习(CRL)旨在创建一系列任务,从简单任务开始并逐步学习到困难任务。在本工作中,我们关注将 CRL 构建为源(辅助)任务分布与目标任务分布之间插值的思想。尽管已有研究显示了该思想的巨大潜力,但如何形式化地量化并生成任务分布之间的迁移仍不清楚。受半监督学习中渐进域适配的启发,我们通过将 CRL 中潜在较大的任务分布偏移分解为较小的偏移来创建自然课程。我们提出 GRADIENT,将 CRL 表述为一个具有任务间定制距离度量的最优传输问题。具体而言,我们生成一系列任务分布作为源分布与目标分布之间的测地插值(即 Wasserstein 重心)。与许多现有方法不同,我们的算法考虑了任务相关的上下文距离度量,并能够处理连续与离散上下文设定下的非参数分布。此外,我们在理论上证明,在某些条件下 GRADIENT 能够实现课程中相邻阶段间的平滑迁移。我们在运动与操控任务上进行了大量实验,结果表明我们提出的 GRADIENT 在学习效率与渐近性能方面均优于基线方法。

关键词

引用

@article{arxiv.2210.10195,
  title  = {Curriculum Reinforcement Learning using Optimal Transport via Gradual Domain Adaptation},
  author = {Peide Huang and Mengdi Xu and Jiacheng Zhu and Laixi Shi and Fei Fang and Ding Zhao},
  journal= {arXiv preprint arXiv:2210.10195},
  year   = {2022}
}