连续域中多任务学习的基准环境
人工智能
2017-08-16 v1
摘要
随着需求驱动系统泛化到各种领域和问题,多任务学习、迁移学习和终身学习的研究已成为日益重要的追求。在离散域中,Atari 游戏套件上的性能已成为评估多任务学习的事实基准。然而,在连续域中,对于标准多任务评估环境缺乏共识,这使得公平比较不同方法变得困难。在这项工作中,我们描述了在基于 OpenAI Gym 的可扩展框架中开发的一组基准任务。我们使用 Trust Region Policy Optimization 运行了一个简单的基线,并公开发布了该框架,以便在连续域中扩展并用于多任务、迁移和终身学习的系统比较。
引用
@article{arxiv.1708.04352,
title = {Benchmark Environments for Multitask Learning in Continuous Domains},
author = {Peter Henderson and Wei-Di Chang and Florian Shkurti and Johanna Hansen and David Meger and Gregory Dudek},
journal= {arXiv preprint arXiv:1708.04352},
year = {2017}
}
备注
Accepted at Lifelong Learning: A Reinforcement Learning Approach Workshop @ ICML, Sydney, Australia, 2017