理解事后机器学习解释中的差异
机器学习
2024-01-29 v1 计算机与社会
机器学习
摘要
先前的研究已强调,现有的事后解释方法在解释保真度上表现出差异(以“种族”和“性别”作为敏感属性),并且尽管大量工作致力于在解释度量层面缓解这些问题,但数据生成过程和黑箱模型在解释差异中所扮演的角色在很大程度上仍未得到探索。因此,通过模拟实验和在一个真实世界数据集上的实验,我们专门评估了源自数据属性的挑战:有限样本量、协变量偏移、概念偏移、遗漏变量偏差,以及基于模型属性的挑战:包含敏感属性和适当的函数形式。通过受控模拟分析,我们的研究表明,协变量偏移、概念偏移和协变量遗漏的增加会加剧解释差异,并且与线性模型相比,这种效应在能更好地捕捉底层函数形式的神经网络模型中更为显著。我们在Adult收入数据集中也观察到了关于概念偏移和遗漏变量偏差对解释差异影响的一致发现。总体而言,结果表明模型解释中的差异也可能取决于数据和模型属性。基于这项系统性研究,我们为设计旨在缓解不良差异的解释方法提供了建议。
引用
@article{arxiv.2401.14539,
title = {Understanding Disparities in Post Hoc Machine Learning Explanation},
author = {Vishwali Mhasawade and Salman Rahman and Zoe Haskell-Craig and Rumi Chunara},
journal= {arXiv preprint arXiv:2401.14539},
year = {2024}
}