中文

基于归因图解释大语言模型的推理过程

人工智能 2025-12-18 v1 计算与语言

摘要

大语言模型(LLM)展现出惊人的能力,但其推理过程仍不透明,这引发了安全与信任方面的顾虑。归因方法为赋予输入特征信用的技术,已被证明对解释计算机视觉模型的决策过程效果显著。基于此,情境归因(context attributions)成为解释自回归LLM行为的有前景的方法。然而,当前的情境归因通过直接将生成标记与提示关联,忽略了过程中的跨生成影响,导致解释不完整。为克服此不足,我们引入情境归因图解释框架(Context Attribution via Graph Explanations, CAGE)。CAGE引入归因图:一种定向图,对每个生成过程的影响进行量化,既包括对提示的影响,也包括对所有先前生成的影响。该图保留两个性质——因果性和行随机性。归因图允许通过对图中路径的中间贡献进行边缘化来计算情境归因。在多个模型、数据集、指标和方法下,CAGE显著提升了情境归因的忠实度,平均提升幅度可达40%。

关键词

引用

@article{arxiv.2512.15663,
  title  = {Explaining the Reasoning of Large Language Models Using Attribution Graphs},
  author = {Chase Walker and Rickard Ewetz},
  journal= {arXiv preprint arXiv:2512.15663},
  year   = {2025}
}