超越平凡反事实解释:以多样化有价值解释揭示模型决策
机器学习
2021-11-12 v2 计算机视觉与模式识别
摘要
鉴于部署更可靠的机器学习系统的重要性,机器学习模型的可解释性在研究界获得了相当多的关注。在计算机视觉应用中,生成式反事实方法指示如何扰动模型的输入以改变其预测,从而提供关于模型决策过程的细节。当前方法往往生成关于模型决策的平凡反事实,因为它们通常建议夸大或移除被分类属性的存在。对于机器学习从业者而言,这类反事实价值甚微,因为它们未提供关于不期望的模型或数据偏差的新信息。在本工作中,我们识别出平凡反事实生成的问题,并提出了 DiVE 以缓解该问题。DiVE 在解耦潜空间中学习扰动,并使用多样性强制损失进行约束,以揭示关于模型预测的多个有价值解释。此外,我们引入一种机制以防止模型产生平凡解释。在 CelebA 和 Synbols 上的实验表明,与先前最先进的方法相比,我们的模型提高了生成高质量有价值解释的成功率。代码可在 https://github.com/ElementAI/beyond-trivial-explanations 获取。
引用
@article{arxiv.2103.10226,
title = {Beyond Trivial Counterfactual Explanations with Diverse Valuable Explanations},
author = {Pau Rodriguez and Massimo Caccia and Alexandre Lacoste and Lee Zamparo and Issam Laradji and Laurent Charlin and David Vazquez},
journal= {arXiv preprint arXiv:2103.10226},
year = {2021}
}
备注
ICCV 2021