中文

DiGrad:面向共享动作的多任务强化学习

机器学习 2018-03-01 v1 人工智能 机器人学 机器学习

摘要

大多数强化学习算法在复杂机器人系统中学习效率低下,这类系统中不同任务共享一组动作。在此类环境中,可学习具有共享神经网络参数的复合策略,从而并发执行多个任务。然而,这种复合策略可能偏向某一任务,或不同任务的梯度相互抵消,导致学习不稳定且有时数据效率较低。本文提出一种在连续动作空间中同时训练共享一组公共动作的多个任务的新方法,称之为DiGrad(差分策略梯度)。所提框架基于差分策略梯度,可在单一 actor-critic 网络中容纳多任务学习。我们还提出差分策略梯度更新中的一种简单启发式方法以进一步改善学习。所提架构在8连杆平面机械臂和27自由度(DoF)人形机器人上进行了测试,分别用于3个和2个末端执行器的多目标可达性任务学习。我们表明,该方法支持复杂机器人系统中的高效多任务学习,在连续动作空间中优于相关方法。

关键词

引用

@article{arxiv.1802.10463,
  title  = {DiGrad: Multi-Task Reinforcement Learning with Shared Actions},
  author = {Parijat Dewangan and S Phaniteja and K Madhava Krishna and Abhishek Sarkar and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:1802.10463},
  year   = {2018}
}