你以为会发生什么?通过预期结果解释智能体行为
人工智能
2020-11-12 v1 计算机与社会
机器学习
机器学习
摘要
我们提出了一种基于预期结果概念的强化学习新型解释方法。这些解释描述了智能体通过其动作试图实现的后果。我们提供了一个简洁证明,表明在传统强化学习中,此类事后解释的一般方法是不可能的。相反,解释所需的信息必须与智能体训练同时收集。我们推导了针对若干 Q 函数近似变体、基于意图提取局部解释的方法,并证明了这些解释与所学 Q 值之间的一致性。我们在多个强化学习问题上展示了我们的方法,并提供了代码以帮助研究人员内省其 RL 环境和算法。
引用
@article{arxiv.2011.05064,
title = {What Did You Think Would Happen? Explaining Agent Behaviour Through Intended Outcomes},
author = {Herman Yau and Chris Russell and Simon Hadfield},
journal= {arXiv preprint arXiv:2011.05064},
year = {2020}
}