中文

基于度量学习的多任务批量强化学习

机器学习 2020-10-27 v6 人工智能 机器学习

摘要

我们解决多任务批量强化学习问题。给定从多个任务收集的数据集,我们训练一个多任务策略,以在从同一分布采样的未见任务上表现良好。未见任务的身份未提供。为表现良好,策略必须从收集的转移中推断任务身份,通过建模其对状态、动作和奖励的依赖关系。由于不同数据集可能具有差异很大的状态-动作分布,任务推断模块可能学会忽略奖励并将\textit{仅}状态-动作对与任务身份虚假关联,导致测试时性能不佳。为使任务推断鲁棒,我们提出了三元组损失的一种新应用。为挖掘困难负样本,我们通过近似训练任务的奖励函数对其转移重新标记。当我们允许在未见任务上进一步训练时,使用训练好的策略作为初始化相比随机初始化策略显著加快收敛(最高 80%80\% 提升,跨 5 种不同 Mujoco 任务分布)。我们将方法命名为 MBML\textbf{MBML}(基于\textbf{度}\text{量}\textbf{学}\text{习}任务\textbf{多}\text{任务}\textbf{批}\text{量}RL)。

关键词

引用

@article{arxiv.1909.11373,
  title  = {Multi-task Batch Reinforcement Learning with Metric Learning},
  author = {Jiachen Li and Quan Vuong and Shuang Liu and Minghua Liu and Kamil Ciosek and Keith Ross and Henrik Iskov Christensen and Hao Su},
  journal= {arXiv preprint arXiv:1909.11373},
  year   = {2020}
}

备注

First two authors contributed equally