中文

你以为会发生什么?通过预期结果解释智能体行为

人工智能 2020-11-12 v1 计算机与社会 机器学习 机器学习

摘要

我们提出了一种基于预期结果概念的强化学习新型解释方法。这些解释描述了智能体通过其动作试图实现的后果。我们提供了一个简洁证明,表明在传统强化学习中,此类事后解释的一般方法是不可能的。相反,解释所需的信息必须与智能体训练同时收集。我们推导了针对若干 Q 函数近似变体、基于意图提取局部解释的方法,并证明了这些解释与所学 Q 值之间的一致性。我们在多个强化学习问题上展示了我们的方法,并提供了代码以帮助研究人员内省其 RL 环境和算法。

关键词

引用

@article{arxiv.2011.05064,
  title  = {What Did You Think Would Happen? Explaining Agent Behaviour Through Intended Outcomes},
  author = {Herman Yau and Chris Russell and Simon Hadfield},
  journal= {arXiv preprint arXiv:2011.05064},
  year   = {2020}
}