中文

用于跨任务与环境迁移与适应的策略合成

机器学习 2021-05-28 v2 机器学习

摘要

强化学习中的迁移能力是构建通用人工智能体的关键。本文中,我们考虑同时跨环境(ENV)与任务(TASK)的迁移学习问题,且更重要的是,仅从所有可能组合中的稀疏(ENV, TASK)对进行学习。我们提出了一种新颖的组合式神经网络架构,其刻画了由环境与任务嵌入组合策略的元规则。值得注意的是,主要挑战之一是与元规则联合学习嵌入。我们进一步提出新的训练方法以解耦嵌入,使其既作为环境与任务的独特签名,又作为组合策略的有效构建块。在 GridWorld 与 Thor 上的实验(智能体以自我中心视角作为输入)表明,我们的方法在仅从 40% 的(ENV, TASK)对学习后,即在所有对上取得了高成功率。

关键词

引用

@article{arxiv.1904.03276,
  title  = {Synthesized Policies for Transfer and Adaptation across Tasks and Environments},
  author = {Hexiang Hu and Liyu Chen and Boqing Gong and Fei Sha},
  journal= {arXiv preprint arXiv:1904.03276},
  year   = {2021}
}

备注

presented at NeurIPS 2018 as a Spotlight