面向文本基可解释 AI 的局部代理模型稳定性估计:致于更稳健与准确
机器学习
2025-01-07 v1 密码学与安全
摘要
最近的研究在 NLP 领域探讨了解释性 AI(XAI)对抗攻击的概念,聚焦于检验基于 LIME 等局部代理方法的鲁棒性,这些方法易受对抗扰动或对机器学习模型输入的微小变化的影响。在此类攻击中,生成的解释被操纵,但原始输入的意义和结构在机器学习模型下保持相似。当 XAI 用于决策依据时(如基于 AI 医学预测器处方药物)或用于法律诉讼时(如涉及 AI 软件的法律争议),此类攻击尤为令人担忧。尽管已显示出许多 XAI 方法的弱点,但背后的原因仍鲜有探讨。XAI 操纵的核心在于用于计算一个解释与另一个解释之间差异的相似度度量标准。差坏的相似度度量标准可能导致对 XAI 方法对抗鲁棒性或稳定性的错误结论。因此,本文调查了设计用于文本基排序列表的多种相似度度量标准,以确定其在相关工作中的比较适用性。我们发现许多度量标准过于敏感,导致对 XAI 方法对抗样本脆弱性的错误估计。随后,我们提出了一种加权方案,用于文本数据,纳入解释中特征之间同义关系,提供对 XAI 方法对抗样本实际脆弱性的更准确估计。
引用
@article{arxiv.2501.02042,
title = {Towards Robust and Accurate Stability Estimation of Local Surrogate Models in Text-based Explainable AI},
author = {Christopher Burger and Charles Walter and Thai Le and Lingwei Chen},
journal= {arXiv preprint arXiv:2501.02042},
year = {2025}
}
备注
12 pages, 1 figure, 4 tables. arXiv admin note: substantial text overlap with arXiv:2406.15839. substantial text overlap with arXiv:2501.01516