中文

相似性度量对文本基可解释人工智能中局部替代模型准确稳定性估计的影响

机器学习 2025-01-20 v2 密码学与安全

摘要

最近的研究探讨了局部替代方法对机器学习(ML)模型输入的脆弱性如何受到对抗扰动的影响,而解释在复杂模型下仍保持与原始输入的意义和结构相似。尽管已显示出许多方法都存在弱点,但导致为何原因却鲜有探讨。可解释人工智能(XAI)对抗攻击的核心概念是用于计算一个解释与另一个解释之间差异的相似性度量。选择不佳的相似性度量会导致对 XAI 方法有效性的错误结论。过于敏感的度量会夸大脆弱性,而过于粗糙则低估其弱点。我们研究了各种为文本基排序列表设计的相似性度量,包括 Kendall's Tau、Spearman's Footrule 和 Rank-biased Overlap,以确定度量类型或成功阈值的变化如何影响来自常见对抗攻击过程生成的结论。发现某些度量过于敏感,导致对稳定性的错误估计。

关键词

引用

@article{arxiv.2406.15839,
  title  = {The Effect of Similarity Measures on Accurate Stability Estimates for Local Surrogate Models in Text-based Explainable AI},
  author = {Christopher Burger and Charles Walter and Thai Le},
  journal= {arXiv preprint arXiv:2406.15839},
  year   = {2025}
}

备注

11 pages, 8 Tables (Minor edits for clarity and grammar)