论最优传输对课程强化学习的益处
机器学习
2024-05-07 v2
摘要
课程强化学习(CRL)通过生成定制的学习任务序列来解决复杂任务,从简单任务开始并逐步提升其难度。尽管各类工作已清晰展现课程在RL中的潜力,但如何为给定学习环境生成课程仍不明确,催生了旨在使该任务自动化的多种方法。本文关注将课程构建为任务分布间的插值,此前已证明这是CRL的一种可行途径。在指出已有方法的关键问题后,我们将课程生成构建为任务分布间的约束最优传输问题。基准测试表明,此种课程生成方式可超越现有CRL方法,在不同特征的多种任务中取得高性能。
引用
@article{arxiv.2309.14091,
title = {On the Benefit of Optimal Transport for Curriculum Reinforcement Learning},
author = {Pascal Klink and Carlo D'Eramo and Jan Peters and Joni Pajarinen},
journal= {arXiv preprint arXiv:2309.14091},
year = {2024}
}