中文

面向机器学习文本分类器的自动可信度测试预言生成

软件工程 2025-05-27 v4 计算与语言 密码学与安全

摘要

用于文本分类的机器学习(ML)已广泛应用于各个领域。这些应用可能对伦理、经济和人类行为产生重大影响,引发了对信任ML决策的严重关切。研究表明,传统指标不足以建立人类对ML模型的信任。这些模型常常学习虚假相关性并据此进行预测。在现实世界中,它们的性能可能显著下降。为避免这种情况,一种常见的做法是基于数据中的有效模式来测试预测是否合理。随之而来的一个挑战被称为可信度测试预言问题。由于缺乏自动化的可信度测试预言,评估需要人工验证由解释方法揭示的决策过程。然而,这既耗时、易出错,又不可扩展。我们提出了TOKI,这是首个面向文本分类器的自动化可信度测试预言生成方法。TOKI自动检查对预测贡献最大的词是否在语义上与预测类别相关。具体来说,我们利用ML解释来提取决策贡献词,并基于词嵌入度量它们与类别的语义相关性。我们还引入了一种新颖的对抗攻击方法,该方法针对TOKI识别的可信度漏洞。为评估其与人类判断的一致性,我们进行了实验。我们将TOKI与仅基于模型置信度的朴素基线,以及TOKI引导的对抗攻击方法与A2T(一种SOTA对抗攻击方法)进行了比较。结果表明,依赖预测不确定性无法有效区分可信与不可信的预测,TOKI的准确率比朴素基线高142%,且TOKI引导的攻击方法比A2T更有效,且所需的扰动更少。

关键词

引用

@article{arxiv.2410.22663,
  title  = {Automated Trustworthiness Oracle Generation for Machine Learning Text Classifiers},
  author = {Lam Nguyen Tung and Steven Cho and Xiaoning Du and Neelofar Neelofar and Valerio Terragni and Stefano Ruberto and Aldeida Aleti},
  journal= {arXiv preprint arXiv:2410.22663},
  year   = {2025}
}

备注

24 pages, 5 tables, 9 figures, Camera-ready version accepted to FSE 2025