基于课程的非对称多任务强化学习
机器学习
2022-11-08 v1
摘要
我们提出 CAMRL,首个基于课程的非对称多任务学习(AMTL)算法,用于一并处理多个强化学习(RL)任务。为缓解在基于课程的 AMTL 中定制一次性训练顺序的负面影响,CAMRL 根据一个关于训练时间、整体性能及任务间性能差距的指标,在并行单任务 RL 与非对称多任务 RL(MTRL)之间切换其训练模式。为灵活利用多源先验知识并减少 AMTL 中的负迁移,我们定制了带多个可微排序函数的复合损失,并通过交替优化与 Frank-Wolfe 算法优化该损失。基于不确定性的超参数自动调整也被用于消除优化过程中繁重的超参数分析需求。通过优化复合损失,CAMRL 预测下一训练任务并持续重访迁移矩阵与网络权重。我们在多任务 RL 的广泛基准上进行了实验,涵盖 Gym-minigrid、Meta-world、Atari 视频游戏、基于视觉的 PyBullet 任务以及 RLBench,以展示 CAMRL 相对于相应单任务 RL 算法与最先进 MTRL 算法的提升。代码见:https://github.com/huanghanchi/CAMRL
引用
@article{arxiv.2211.03352,
title = {Curriculum-based Asymmetric Multi-task Reinforcement Learning},
author = {Hanchi Huang and Deheng Ye and Li Shen and Wei Liu},
journal= {arXiv preprint arXiv:2211.03352},
year = {2022}
}
备注
Accepted by TPAMI (IEEE Transactions on Pattern Analysis and Machine Intelligence)