通过主动采样学习多任务
神经与进化计算
2017-05-23 v4 机器学习
摘要
在人工智能中学习目标导向行为的长期挑战之一是构建一个能解决多个任务的单一智能体。近期,针对目标导向序列问题的多任务学习进展以基于蒸馏的学习形式出现,其中学生网络通过模仿专家网络的任务特定策略,从多个任务特定专家网络中学习。虽然此类方法为多任务学习问题提供了有前景的解决方案,但它们需要大型专家网络的监督,而这些专家网络需要大量数据和计算时间进行训练。在本工作中,我们提出了一种高效的多任务学习框架,该框架在在线设置中解决多个目标导向任务,且无需专家监督。我们的工作利用主动学习原理,通过比对简单任务更频繁地采样困难任务来实现多任务学习。我们在主动采样框架下提出了三种不同的模型:一种具有极具竞争力多任务性能的自适应方法;一种基于UCB的元学习器,其将选择下一个训练任务的问题视为多臂老虎机问题;一种元学习方法,其将下一任务选择问题视为完整的强化学习问题,并使用演员-评论家方法直接优化多任务性能。我们在Atari 2600领域展示了七个多任务实例上的结果:三个6任务实例、一个8任务实例、两个12任务实例和一个21任务实例。
引用
@article{arxiv.1702.06053,
title = {Learning to Multi-Task by Active Sampling},
author = {Sahil Sharma and Ashutosh Jha and Parikshit Hegde and Balaraman Ravindran},
journal= {arXiv preprint arXiv:1702.06053},
year = {2017}
}
备注
11 pages + 30 page appendix