中文

学习解释:从变换器注意力模式中进行监督式标记归因

计算与语言 2026-01-22 v2 机器学习

摘要

随着变换器模型在医疗、法律和金融等高风险应用领域的部署,解释人工智能(XAI)变得至关重要,因为模型的不透明性会阻碍信任和问责制。变换器自注意力机制已被证明对模型可解释性具有重要价值,注意力权重已成功用于理解模型关注点和行为。然而,现有的基于注意力的解释方法依赖于手动定义的聚合策略和固定的归因规则,而模型中性方法(如 LIME、SHAP)则将模型视为黑盒,并通过输入扰动产生显著的计算成本。我们引入解释网络(ExpNet),一个轻量级神经网络,用于学习从变换器注意力模式到标记级别重要性得分的显式映射。与先前方法不同,ExpNet自动发现最优的注意力特征组合,而无需依赖预先确定的规则。在具有挑战性的跨任务设置中对ExpNet进行评估,并将其与广泛的模型中性方法和注意力技术进行基准测试,这些方法跨越四个方法论家族。

关键词

引用

@article{arxiv.2601.14112,
  title  = {Learning to Explain: Supervised Token Attribution from Transformer Attention Patterns},
  author = {George Mihaila},
  journal= {arXiv preprint arXiv:2601.14112},
  year   = {2026}
}