中文

MCP:利用乘法组合策略学习可组合的分层控制

机器学习 2019-05-24 v1 机器学习

摘要

人类能够借助以往经验获得的技能来完成大量复杂任务。要使自主智能体具备这种能力,它们必须能从过去经验中提取可复用的技能,并以新方式重组用于后续任务。此外,当控制如人形身体等复杂高维形态时,任务常需同时协调多种技能。为每种技能组合学习离散基元很快变得不可行。可组合基元能够被重组以产生大量行为,更适于建模这种组合爆炸。本工作中,我们提出乘法组合策略(MCP),一种用于学习可复用运动技能、可组合以产生一系列复杂行为的方法。我们的方法将智能体的技能分解为一组基元,其中多个基元可通过乘法组合同时激活。这种灵活性使得基元能够被迁移和重组,以针对新任务的需要引发新行为。我们证明,MCP 能够从预训练任务(如运动模仿)中为高度复杂的模拟角色提取可组合技能,然后复用这些技能解决具有挑战性的连续控制任务,例如将足球带向球门,以及拾取物体并将其运送至目标位置。

关键词

引用

@article{arxiv.1905.09808,
  title  = {MCP: Learning Composable Hierarchical Control with Multiplicative Compositional Policies},
  author = {Xue Bin Peng and Michael Chang and Grace Zhang and Pieter Abbeel and Sergey Levine},
  journal= {arXiv preprint arXiv:1905.09808},
  year   = {2019}
}