基于表格数据的概念级解释
机器学习
2022-09-14 v1 计算机视觉与模式识别
摘要
机器学习模型的可解释性一直是机器学习系统安全部署的重要研究领域。其中一种方法是将模型决策归因到人类可理解的高层概念。然而,针对深度神经网络(DNNs)的此类基于概念的可解释性主要在图像领域被研究。本文通过将概念定义在表格数据上的思路,将概念归因方法 TCAV 扩展到表格学习。在一个具有真实概念解释的的合成数据集和一个真实世界数据集上,我们展示了所提方法在生成符合人类直觉的可解释性结果方面的有效性。在此基础上,我们提出了一种基于 TCAV 的公平性概念,用于量化 DNN 的哪一层学到了导致模型偏倚预测的表示。此外,我们通过实验证明了基于 TCAV 的公平性与群体公平性概念 Demographic Parity 之间的关系。
引用
@article{arxiv.2209.05690,
title = {Concept-Based Explanations for Tabular Data},
author = {Varsha Pendyala and Jihye Choi},
journal= {arXiv preprint arXiv:2209.05690},
year = {2022}
}