基于最优传输正则化的多任务强化学习知识蒸馏
机器学习
2023-09-28 v1
摘要
在多任务强化学习中,通过从其他不同但相关的任务转移知识,可以提高训练智能体的数据效率。由于来自不同任务的经验通常偏向于特定任务目标,传统方法依赖 Kullback-Leibler 正则化来稳定从一个任务到其他任务的知识转移。在本文中,我们探索用一种新颖的基于最优传输的正则化替代 Kullback-Leibler 散度的方向。通过使用 Sinkhorn 映射,我们可以近似任务间状态分布的最优传输距离。该距离随后被用作摊销奖励以正则化共享信息的量。我们在多个基于网格的多目标导航任务上实验了我们的框架,以验证方法的有效性。结果表明,我们添加的基于最优传输的奖励能够加速智能体的学习过程,并在多任务学习上优于若干基线。
引用
@article{arxiv.2309.15603,
title = {Distill Knowledge in Multi-task Reinforcement Learning with Optimal-Transport Regularization},
author = {Bang Giang Le and Viet Cuong Ta},
journal= {arXiv preprint arXiv:2309.15603},
year = {2023}
}
备注
6 pages,