通过生成邻域中的逐字边界识别实现人在回路的模型解释
人工智能
2021-06-25 v1
摘要
机器学习模型的黑盒性质限制了其在关键场景应用中的使用,引发了忠实性与伦理担忧,导致信任危机。缓解此问题的一种可能方式是理解一个(错误预测的)决策是如何从决策边界中划分出来的。本文提出一种人在回路的方法,利用逐字邻域表征来解释机器学习模型。与当前大多数提供碰运式近似解释的可解释人工智能(XAI)系统不同,我们的方法生成给定实例的局部决策边界,并使人类智能能够推断模型行为。我们的方法可分为三个阶段:1)邻域生成阶段,基于给定样本生成实例;2)分类阶段,对生成实例进行分类以刻画局部决策边界并描绘模型行为;3)人在回路阶段,由人类细化并探索感兴趣的邻域。在生成阶段,使用生成模型在给定实例周围生成合理的合成邻域样本。分类阶段后,已分类的邻域实例提供了对模型行为的多面理解。人在回路阶段提供了三个干预点,使人类能够利用其自身智能解释模型行为。在两个数据集上进行了若干实验,实验结果表明我们所提方法在增进人类对复杂机器学习模型理解方面的潜力。
引用
@article{arxiv.2106.13093,
title = {Human-in-the-loop model explanation via verbatim boundary identification in generated neighborhoods},
author = {Xianlong Zeng and Fanghao Song and Zhongen Li and Krerkkiat Chusap and Chang Liu},
journal= {arXiv preprint arXiv:2106.13093},
year = {2021}
}