中文

用于深度强化学习的循环控制网络

机器学习 2019-01-21 v2 人工智能 机器学习

摘要

中枢模式发生器(CPGs)是能够在无节律输入情况下产生协调节律输出的生物神经回路。因此,它们负责生物体大多数的节律运动。这种节律控制广泛适用于运动机器人和医疗器械等领域。在本文中,我们探索创建一种自维持的 CPG 网络用于强化学习,该网络比当前的多层感知机(MLP)基线模型更高效地学习节律运动,并适用于更通用的环境。近期工作提出了结构化控制网络(SCN),其分别使用线性和非线性模块进行局部和全局控制。在此,我们表明循环神经网络(RNNs)等时间序列架构能有效建模 CPGs。结合先前关于 RNNs 和 SCNs 的工作,我们引入循环控制网络(RCN),其为网络添加了一个线性组件;RCNs 在所有环境任务上匹配并超越了基线 MLPs 和 SCNs 的性能。我们的发现证实了 RNNs 在强化学习任务上的已有直觉,并展示了类 SCN 结构在强化学习中的前景。

关键词

引用

@article{arxiv.1901.01994,
  title  = {Recurrent Control Nets for Deep Reinforcement Learning},
  author = {Vincent Liu and Ademi Adeniji and Nathaniel Lee and Jason Zhao and Mario Srouji},
  journal= {arXiv preprint arXiv:1901.01994},
  year   = {2019}
}