可解释人工智能:面向Transformer模型的上下文感知层级集成梯度
计算与语言
2026-05-21 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
Transformer模型在诸多领域和任务中实现了最先进的性能,但其深层表征使得其预测难以解释。现有解释方法依赖最终层的归因,或只能捕获局部token级归因或全局注意力模式,且缺乏对token间依赖关系和结构组件的上下文感知。它们也无法捕捉相关性如何随层级演变以及结构组件如何塑造决策的过程。为此,我们提出了\textbf{基于上下文感知的层级集成梯度(CA-LIG)框架},作为一种统一的层级归因框架,计算每个Transformer模块内的层级集成梯度,并将这些token级归因与类别特定注意力梯度融合。这种集成产生带符号、具上下文感知的归因图,捕捉支持性与反对性证据,同时追踪Transformer层级中相关性的流动。我们在多样化的任务、领域和Transformer模型族中评估了CA-LIG框架,包括基于BERT的情感分析与长期多类别文档分类、基于XLM-R与AfroLM的低资源语言环境下的仇恨言论检测,以及基于Masked Autoencoder视觉Transformer的图像分类。在所有任务与架构中,CA-LIG提供更具忠实性的归因,显示出对上下文依赖关系的更强灵敏性,并产生更清晰、更语义连贯的可视化结果。这些结果表明,CA-LIG为Transformer决策提供了更全面、更具上下文感知且更可靠的解释,推动了深度神经模型的实用可解释性和概念性理解。
引用
@article{arxiv.2602.16608,
title = {Explainable AI: Context-Aware Layer-Wise Integrated Gradients for Explaining Transformer Models},
author = {Melkamu Abay Mersha and Jugal Kalita},
journal= {arXiv preprint arXiv:2602.16608},
year = {2026}
}