使用目标学徒的强化学习跨域迁移
人工智能
2018-01-23 v1 机器学习
机器学习
摘要
在本文中,我们提出一种用于跨域任务的强化学习(RL)中迁移学习(TL)的新方法。许多现有方法将迁移架构视为加速目标任务学习的一种方法。我们提议在相关域中直接适配并重用映射后的源任务最优策略。我们表明,只要一个自适应策略考虑目标与源之间的模型误差,来自相关源任务的最优策略在目标域中可以是近最优的。这种策略增强的主要好处是在多个相关域间泛化策略,而无需重新学习新任务。我们的结果表明,该架构在迁移中带来更好的样本效率,将目标任务学习的样本复杂度降低到目标学徒学习。
引用
@article{arxiv.1801.06920,
title = {Cross-Domain Transfer in Reinforcement Learning using Target Apprentice},
author = {Girish Joshi and Girish Chowdhary},
journal= {arXiv preprint arXiv:1801.06920},
year = {2018}
}
备注
To appear as conference paper in ICRA 2018