中文

连续域中多任务学习的基准环境

人工智能 2017-08-16 v1

摘要

随着需求驱动系统泛化到各种领域和问题,多任务学习、迁移学习和终身学习的研究已成为日益重要的追求。在离散域中,Atari 游戏套件上的性能已成为评估多任务学习的事实基准。然而,在连续域中,对于标准多任务评估环境缺乏共识,这使得公平比较不同方法变得困难。在这项工作中,我们描述了在基于 OpenAI Gym 的可扩展框架中开发的一组基准任务。我们使用 Trust Region Policy Optimization 运行了一个简单的基线,并公开发布了该框架,以便在连续域中扩展并用于多任务、迁移和终身学习的系统比较。

关键词

引用

@article{arxiv.1708.04352,
  title  = {Benchmark Environments for Multitask Learning in Continuous Domains},
  author = {Peter Henderson and Wei-Di Chang and Florian Shkurti and Johanna Hansen and David Meger and Gregory Dudek},
  journal= {arXiv preprint arXiv:1708.04352},
  year   = {2017}
}

备注

Accepted at Lifelong Learning: A Reinforcement Learning Approach Workshop @ ICML, Sydney, Australia, 2017