中文

NoMatterXAI:用于解释黑箱文本分类模型生成“无论如何”替代事实示例

计算与语言 2024-08-21 v1

摘要

在可解释人工智能(XAI)中,替代解释(CE)是通过"什么如果"的对比推理来传达特征相关性的一种已研究方法,但它们仅关注重要(即相关)的特征,而基本忽略不重要(即无关)的特征。在许多应用中,这些无关特征至关重要,尤其是当用户需要确保AI模型的决策不受特定属性(如性别、种族、宗教或政治立场)影响或偏见时。为此提出了替代事实解释(AE)的概念。AE探索一种"无论如何"的替代现实,其中将无关特征替换为同一属性内的替代特征(例如"republicans"->"democrats"),同时保持相似的预测输出。这用于验证AI模型的预测是否受到指定属性的影响。尽管AE有着巨大的潜力,但在文本领域缺乏系统性生成它们的计算方法,尤其是为AI文本分类器生成AE存在独特挑战。本文通过将AE生成形式化为一个优化问题,提出了一种新颖算法MoMatterXAI,用于生成文本分类任务的AE。我们的 метод在多个模型和数据集上实现了最高达95%的忠实度,同时保持超过90%的上下文相似性。人类研究进一步验证了AE在向最终用户解释AI文本分类器方面的有效性。所有代码将公开 disponible。

关键词

引用

@article{arxiv.2408.10528,
  title  = {NoMatterXAI: Generating "No Matter What" Alterfactual Examples for Explaining Black-Box Text Classification Models},
  author = {Tuc Nguyen and James Michels and Hua Shen and Thai Le},
  journal= {arXiv preprint arXiv:2408.10528},
  year   = {2024}
}