Contrast-CAT:基于对比激活在 Transformer 文本分类器中的解释性提升
偏微分方程分析
2025-07-30 v1
摘要
Transformer 对 AI 研究产生了深远影响,但即便是对于分类这类相对较简单的任务,解释其决策也仍具有挑战性,这会阻碍其在实际应用中的可信度和安全部署。尽管激活基方法在解释 Transformer 文本分类模型方面效果良好,但我们的发现表明,这些方法可能因激活中包含的与类别无关的特征而受到削弱,导致解释可靠性较低。为解决这一局限性,我们提出了 Contrast-CAT,这是一种基于激活对比的归因方法,通过过滤掉类别无关的特征来细化 token 级别的归因。通过对输入序列的激活与参考激活进行对比,Contrast-CAT 生成更清晰且更可信的归因图。实验结果表明,Contrast-CAT 在 various 数据集和模型上均显著优于当前最先进的方法。值得注意的是,在 MoRF 设置下,它在 AOPC 和 LOdds 方面的平均提升分别为 x1.30 和 x2.25,充分展示了其在提升 Transformer 文本分类可解释性方面的有效性。
引用
@article{arxiv.2507.21185,
title = {Comparison principle for Singular Fractional $ g- $Laplacian Problems},
author = {Abdelhamid Gouasmia and Kaushik Bal},
journal= {arXiv preprint arXiv:2507.21185},
year = {2025}
}
备注
26 pages