软专家引导下面临不完美演示的强化学习
机器学习
2019-11-26 v2 人工智能
机器人学
机器学习
摘要
本文研究从演示中学习(RLfD)的方法,该方法通过提供专家演示来提高强化学习(RL)的探索效率。现有大多数 RLfD 方法要求演示完美且充分,但这在实践中难以满足。为处理不完美演示,我们首先以形式化方式定义 RLfD 的不完美专家设定,进而指出以往方法分别在最优性与收敛性方面存在两个问题。基于所推导的理论发现,我们将专家引导视为约束智能体策略探索的软约束,从而将上述两个问题转化为一个约束优化问题。我们进一步证明,通过对该问题的对偶形式进行局部线性搜索,可高效求解此问题。在大量基准测试上的充分实证评估表明,我们的方法相较于其他 RLfD 方法取得了稳定一致的改进。
引用
@article{arxiv.1911.07109,
title = {Reinforcement Learning from Imperfect Demonstrations under Soft Expert Guidance},
author = {Mingxuan Jing and Xiaojian Ma and Wenbing Huang and Fuchun Sun and Chao Yang and Bin Fang and Huaping Liu},
journal= {arXiv preprint arXiv:1911.07109},
year = {2019}
}
备注
Accepted to AAAI 2020. Xiaojian Ma and Mingxuan Jing contributed equally to this work