中文

基于后继特征与广义策略改进的深度强化学习迁移

机器学习 2019-01-31 v1 人工智能

摘要

跨任务迁移技能的能力有潜力将强化学习(RL)智能体扩展到当前难以触及的环境。近来,一种基于后继特征(SFs)与广义策略改进(GPI)两个思想的框架被提出,作为迁移技能的原则性方法。本文以两种方式扩展 SFs & GPI 框架。SFs & GPI 原始表述的基本假设之一是,所有感兴趣任务的奖励均可计算为一组固定特征的线性组合。我们放宽该约束,并表明支持该框架的理论保证可扩展至仅奖励函数不同的任意任务集。我们的第二个贡献是表明,可将奖励函数自身作为未来任务的特征使用,且不损失表达能力,从而免去预先指定特征集的需要。这使得以更稳定的方式将 SFs & GPI 与深度学习结合成为可能。我们在一个复杂的 3D 环境中以经验验证此主张,其中观测为第一人称视角图像。我们表明 SFs & GPI 促进的迁移几乎瞬时地在未见任务上得到非常好的策略。我们还描述了如何学习专用于新任务的策略,使其能被加入智能体的技能集从而未来可复用。

关键词

引用

@article{arxiv.1901.10964,
  title  = {Transfer in Deep Reinforcement Learning Using Successor Features and Generalised Policy Improvement},
  author = {André Barreto and Diana Borsa and John Quan and Tom Schaul and David Silver and Matteo Hessel and Daniel Mankowitz and Augustin Žídek and Rémi Munos},
  journal= {arXiv preprint arXiv:1901.10964},
  year   = {2019}
}

备注

Published at ICML 2018