解耦动态与奖励以用于迁移学习
机器学习
2018-05-10 v2 人工智能
机器学习
摘要
当前的强化学习(RL)方法可以成功学习单一任务,但往往对任务领域或训练过程中的微小扰动泛化能力较差。在这项工作中,我们提出一种用于强化学习的解耦学习策略,其创建一个可鲁棒迁移知识的共享表示空间。我们将任务表示、前向动力学、逆向动力学和领域奖励函数的学习分离开来,并表明这种解耦提升了任务内的性能,对动力学和奖励的变化迁移良好,并且可有效用于在线规划。实证结果显示在连续与离散强化学习领域均有良好表现。
引用
@article{arxiv.1804.10689,
title = {Decoupling Dynamics and Reward for Transfer Learning},
author = {Amy Zhang and Harsh Satija and Joelle Pineau},
journal= {arXiv preprint arXiv:1804.10689},
year = {2018}
}