你的解释可靠吗?结合 XAI 与对抗攻击探究 LIME 在文本分类器解释中的稳定性
机器学习
2023-10-17 v2 计算与语言
摘要
LIME 已成为可解释 AI(XAI)框架中最常被引用的工具之一,并被集成到关键的机器学习应用中——例如医疗和金融。然而,其稳定性仍鲜有探索,尤其在文本数据背景下,由于独特的文本空间约束所致。为应对这些挑战,本文首先评估 LIME 在文本数据上的固有不稳定性以建立基线,随后提出一种新颖算法 XAIFooler 来扰动文本输入并操纵解释,将 LIME 稳定性研究转化为文本扰动优化问题。XAIFooler 遵循约束以在小扰动下保留文本语义和原始预测,并引入排序偏置重叠(RBO)作为关键部分来引导 XAIFooler 的优化,满足解释相似性度量的所有要求。在真实世界文本数据集上的大量实验表明,XAIFooler 在操纵 LIME 解释且高语义保持能力方面显著大幅优于所有基线。
引用
@article{arxiv.2305.12351,
title = {Are Your Explanations Reliable? Investigating the Stability of LIME in Explaining Text Classifiers by Marrying XAI and Adversarial Attack},
author = {Christopher Burger and Lingwei Chen and Thai Le},
journal= {arXiv preprint arXiv:2305.12351},
year = {2023}
}
备注
14 pages, 6 figures. Replacement by the updated version to be published in EMNLP 2023