FreaAI:用于测试机器学习模型的数据切片自动提取
机器学习
2021-08-13 v1 应用统计
摘要
机器学习(ML)解决方案十分普遍。然而,使这些解决方案达到业务级仍存在诸多挑战。一大挑战是确保 ML 解决方案提供其预期的业务价值。为此,必须弥合 ML 模型性能度量方式与解决方案需求之间的差距。在先前工作(Barash 等,“Bridging the gap...”)中,我们展示了利用特征模型弥合此差距的有效性。ML 性能指标(如分类器的准确率或 F1-score)通常度量平均 ML 性能,而特征模型则揭示偏离该平均值过多的可解释数据切片,因此可能指示未满足的需求。例如,某银行文本条款分类器的整体准确率可能非常高,如 ,但对于包含简短描述且来自商业账户的条款,其表现可能很差。一项可能隐含于训练数据中的业务需求,可能是无论账户类型与描述长度如何都表现良好。因此,包含简短描述与商业账户的欠性能数据切片暗示需求未得到满足。本文中,我们展示了自动提取特征模型的可行性,这些模型产生 ML 解决方案表现不佳的可解释数据切片。我们的新技术,IBM FreaAI(又称 FreaAI),从结构化 ML 测试数据或任何其他标注数据中提取此类切片。我们证明 FreaAI 能在七个开放数据集上自动产生可解释且统计显著的数据切片。
引用
@article{arxiv.2108.05620,
title = {FreaAI: Automated extraction of data slices to test machine learning models},
author = {Samuel Ackerman and Orna Raz and Marcel Zalmanovici},
journal= {arXiv preprint arXiv:2108.05620},
year = {2021}
}