中文

基于期望后果的强化学习对比解释

机器学习 2018-07-24 v1 机器学习

摘要

机器学习模型在复杂任务中变得日益精通。然而,即使是该领域的专家,也难以理解模型学到了什么。这阻碍了信任与接受,并妨碍了修正模型的可能性。因此需要对机器学习模型的透明性。透明分类模型的发展已受到诸多关注,但实现透明强化学习(RL)模型的进展甚少。在本研究中,我们提出一种方法,使 RL 智能体能依据状态转移与结果的期望后果解释其行为。首先,我们定义将状态与动作翻译为对人类用户更易理解的描述。其次,我们开发了一种使智能体获取单一动作后果及其整个策略后果的过程。该方法计算源自用户查询的策略与智能体所学策略的后果之间的对比。第三,构建了生成解释的格式。开展了一项试点调查研究以探索用户对不同解释属性的偏好。结果表明人类用户倾向于偏好关于策略而非单一动作的解释。

关键词

引用

@article{arxiv.1807.08706,
  title  = {Contrastive Explanations for Reinforcement Learning in terms of Expected Consequences},
  author = {Jasper van der Waa and Jurriaan van Diggelen and Karel van den Bosch and Mark Neerincx},
  journal= {arXiv preprint arXiv:1807.08706},
  year   = {2018}
}

备注

XAI workshop on the IJCAI conference 2018, Stockholm, Sweden