面向不平衡数据的可解释机器学习
机器学习
2022-12-16 v1
摘要
深度学习模型正日益应用于医学、自动驾驶与情报分析等高风险领域中的不平衡数据。不平衡数据加剧了深度网络的黑箱性质,因为类之间的关系可能高度偏斜且不清晰。这会降低模型使用者的信任,并阻碍不平衡学习算法开发者的进展。现有研究不平衡数据复杂性的方法面向二分类、浅层学习模型与低维数据。此外,当前可解释人工智能(XAI)技术主要聚焦于将不透明深度学习模型转换为更简单的模型(如决策树)或将特定实例的预测映射到输入,而非考察全局数据属性与复杂性。因此,亟需一个适配现代深度网络、纳入大规模高维多类数据集、并揭示不平衡数据中常见数据复杂性(如类重叠、子概念与离群实例)的框架。我们提出一组技术,深度模型使用者可用其识别、可视化并理解类原型、子概念与离群实例;不平衡学习算法开发者可用其检测对模型性能至关重要的特征与类样本。我们的框架还识别位于类决策边界上的实例,其可携带高度判别性信息。与许多将模型决策映射到灰度像素位置的现有 XAI 技术不同,我们利用通过反向传播的显著性来识别并聚合整个类上的图像色带。我们的框架公开于 \url{https://github.com/dd1github/XAI_for_Imbalanced_Learning}。
引用
@article{arxiv.2212.07743,
title = {Interpretable ML for Imbalanced Data},
author = {Damien A. Dablain and Colin Bellinger and Bartosz Krawczyk and David W. Aha and Nitesh V. Chawla},
journal= {arXiv preprint arXiv:2212.07743},
year = {2022}
}