中文

通用后继特征逼近器

机器学习 2018-12-20 v1 人工智能 机器学习

摘要

强化学习(RL)智能体同时学习多个奖励函数的能力具有许多潜在好处,例如将复杂任务分解为更简单的任务、任务间的信息交换以及技能的复用。我们特别关注其中一个方面,即泛化到未见过任务的能力。参数化泛化依赖于以任务描述为输入的函数逼近器的插值能力;其最常见形式之一是通用值函数逼近器(UVFAs)。另一种泛化到新任务的方法是利用 RL 问题本身的结构。广义策略改进(GPI)将先前任务的解决方案组合成用于未见过任务的策略;这依赖于旧策略在新奖励函数下的即时策略评估,而通过后继特征(SFs)可实现这一点。我们提出的通用后继特征逼近器(USFAs)结合了所有这些的优点,即 UVFAs 的可扩展性、SFs 的即时推断以及 GPI 的强泛化能力。我们讨论了训练 USFA 所涉及的挑战、其泛化特性,并在一个大规模领域中展示了其实用好处和迁移能力,其中智能体须在以第一人称视角三维环境中进行导航。

关键词

引用

@article{arxiv.1812.07626,
  title  = {Universal Successor Features Approximators},
  author = {Diana Borsa and André Barreto and John Quan and Daniel Mankowitz and Rémi Munos and Hado van Hasselt and David Silver and Tom Schaul},
  journal= {arXiv preprint arXiv:1812.07626},
  year   = {2018}
}