机器学习分类器的自动可信度测试
机器学习
2024-06-11 v1 软件工程
摘要
机器学习( ML)已成为社会不可分割的一部分,广泛应用于金融、医疗和交通等关键领域。因此,关键在于评估不仅ML模型是否做出正确预测,更重要的是它们是否因此做出正确判断,以确保我们可信赖的模型在未见数据上表现良好。这一概念被称为ML的可信度。最近发展出解释技术(如LIME, SHAP)以解释ML模型的决策过程,提供有关预测(例如输入中最影响预测的词语)的解释。评估这些解释的合理性可增强我们对模型可信度的信心。然而,现有方法通常依赖人类判断来确定解释的合理性。本文提出TOWER技术,首个自动创建可信度oracle以确定文本分类器预测是否可信。它利用词嵌入自动评估基于解释技术输出的模型中立文本分类器的可信度。我们的假设是,如果预测的解释中的词语与预测类别相关联,则该预测是可信的。我们使用来自噪声数据的不可信模型进行无监督学习,以找到TOWER的最佳配置。随后我们在我们创建的人类标注的可信度数据集上评估了TOWER。结果显示,TOWER能够检测到随噪声增加而可信度下降,但在针对人类标注数据集时并不有效。我们的初始实验表明,该假设是有效且有前景的,但需要进一步研究来更好地理解解释与可信度问题之间的关系。
引用
@article{arxiv.2406.05251,
title = {Automated Trustworthiness Testing for Machine Learning Classifiers},
author = {Steven Cho and Seaton Cousins-Baxter and Stefano Ruberto and Valerio Terragni},
journal= {arXiv preprint arXiv:2406.05251},
year = {2024}
}