基于偏好代价学习的任务迁移
机器学习
2019-02-19 v3 机器人学
机器学习
摘要
强化学习中任务迁移的目标是将智能体的动作策略从源任务迁移到目标任务。鉴于其在机器人动作规划上的成功,当前方法主要依赖于两个要求:完全相关的专家示范,或针对目标任务显式编码的代价函数;然而,这两者在实践中均难以获得。在本文中,我们通过开发一个以专家偏好为指导的新型任务迁移框架,放宽了这两个强条件。具体而言,我们交替执行以下两个步骤:首先,让专家应用预定义的偏好规则,为目标任务选择相关的专家示范;其次,基于选择结果,我们通过增强的对抗最大熵逆强化学习(Adversarial MaxEnt IRL)同时学习目标代价函数和轨迹分布,并由学习到的目标分布生成更多轨迹用于下一次偏好选择。我们提供了关于所提算法的分布学习和收敛性的理论分析。在多个基准上进行了广泛仿真,进一步验证了所提方法的有效性。
引用
@article{arxiv.1805.04686,
title = {Task Transfer by Preference-Based Cost Learning},
author = {Mingxuan Jing and Xiaojian Ma and Wenbing Huang and Fuchun Sun and Huaping Liu},
journal= {arXiv preprint arXiv:1805.04686},
year = {2019}
}
备注
Accepted to AAAI 2019. Mingxuan Jing and Xiaojian Ma contributed equally to this work