基于线性模型U树的可解释深度强化学习
机器学习
2018-07-17 v1 机器学习
摘要
深度强化学习(DRL)在许多应用中取得了令人瞩目的成功。许多DRL模型的一个关键组件是表示Q函数的神经网络,用于估计状态-动作对之后的期望累积奖励。Q函数神经网络包含大量关于强化学习问题的隐式知识,但往往未被检验和解释。据我们所知,本工作开发了首个针对DRL中Q函数的模仿学习框架。我们引入线性模型U树(LMUTs)来近似神经网络预测。LMUT使用一种新颖的在线算法学习,该算法非常适合于主动对弈设置,其中模仿学习者观察神经网络与环境之间的持续交互。实证评估表明,LMUT对Q函数的模仿效果显著优于五种基线方法。LMUT透明的树结构有助于通过分析特征影响、提取规则以及高亮图像输入中的超像素来理解网络学到的知识。
引用
@article{arxiv.1807.05887,
title = {Toward Interpretable Deep Reinforcement Learning with Linear Model U-Trees},
author = {Guiliang Liu and Oliver Schulte and Wang Zhu and Qingcan Li},
journal= {arXiv preprint arXiv:1807.05887},
year = {2018}
}
备注
This paper is accepted by ECML-PKDD 2018