中文

基于最优传输正则化的多任务强化学习知识蒸馏

机器学习 2023-09-28 v1

摘要

在多任务强化学习中,通过从其他不同但相关的任务转移知识,可以提高训练智能体的数据效率。由于来自不同任务的经验通常偏向于特定任务目标,传统方法依赖 Kullback-Leibler 正则化来稳定从一个任务到其他任务的知识转移。在本文中,我们探索用一种新颖的基于最优传输的正则化替代 Kullback-Leibler 散度的方向。通过使用 Sinkhorn 映射,我们可以近似任务间状态分布的最优传输距离。该距离随后被用作摊销奖励以正则化共享信息的量。我们在多个基于网格的多目标导航任务上实验了我们的框架,以验证方法的有效性。结果表明,我们添加的基于最优传输的奖励能够加速智能体的学习过程,并在多任务学习上优于若干基线。

关键词

引用

@article{arxiv.2309.15603,
  title  = {Distill Knowledge in Multi-task Reinforcement Learning with Optimal-Transport Regularization},
  author = {Bang Giang Le and Viet Cuong Ta},
  journal= {arXiv preprint arXiv:2309.15603},
  year   = {2023}
}

备注

6 pages,