基于度量学习的多任务批量强化学习
机器学习
2020-10-27 v6 人工智能
机器学习
摘要
我们解决多任务批量强化学习问题。给定从多个任务收集的数据集,我们训练一个多任务策略,以在从同一分布采样的未见任务上表现良好。未见任务的身份未提供。为表现良好,策略必须从收集的转移中推断任务身份,通过建模其对状态、动作和奖励的依赖关系。由于不同数据集可能具有差异很大的状态-动作分布,任务推断模块可能学会忽略奖励并将状态-动作对与任务身份虚假关联,导致测试时性能不佳。为使任务推断鲁棒,我们提出了三元组损失的一种新应用。为挖掘困难负样本,我们通过近似训练任务的奖励函数对其转移重新标记。当我们允许在未见任务上进一步训练时,使用训练好的策略作为初始化相比随机初始化策略显著加快收敛(最高 提升,跨 5 种不同 Mujoco 任务分布)。我们将方法命名为 (基于的RL)。
引用
@article{arxiv.1909.11373,
title = {Multi-task Batch Reinforcement Learning with Metric Learning},
author = {Jiachen Li and Quan Vuong and Shuang Liu and Minghua Liu and Kamil Ciosek and Keith Ross and Henrik Iskov Christensen and Hao Su},
journal= {arXiv preprint arXiv:1909.11373},
year = {2020}
}
备注
First two authors contributed equally