中文

通过任务归约求解组合强化学习问题

机器学习 2021-03-22 v2

摘要

我们提出一种新颖的学习范式——基于归约的自我模仿(SIR),用于求解组合强化学习问题。SIR 基于两个核心思想:任务归约与自我模仿。任务归约通过主动将难解任务归约为强化学习智能体已知解的较易任务来应对困难任务。一旦原困难任务经任务归约成功求解,智能体自然获得一条可模仿的自生成解轨迹。通过持续收集并模仿此类示范,智能体能够逐步扩展整个任务空间中被求解的子空间。实验结果表明,SIR 能在多种具有组合结构的稀疏奖励连续控制挑战性问题上显著加速并改善学习。代码与视频见 https://sites.google.com/view/sir-compositional。

关键词

引用

@article{arxiv.2103.07607,
  title  = {Solving Compositional Reinforcement Learning Problems via Task Reduction},
  author = {Yunfei Li and Yilin Wu and Huazhe Xu and Xiaolong Wang and Yi Wu},
  journal= {arXiv preprint arXiv:2103.07607},
  year   = {2021}
}

备注

Project website link updated