中文

Hessian增强的Token归因(HETA):用于解释自回归LLM

计算与语言 2026-04-16 v1 人工智能

摘要

归因方法寻求通过量化输入标记对生成输出的贡献来解释语言模型预测。然而,大多数现有技术为编码器体系结构设计,依赖线性近似,无法捕捉自回归生成在解码器-only模型中的因果性和语义复杂性。为此,我们提出Hessian增强的Token归因(Hessian-Enhanced Token Attribution, HETA),一种专为解码器-only语言模型设计的新型归因框架。HETA整合了三个互补组件:捕捉跨层次token间影响的语义过渡向量、建模二阶效应的Hessian敏感性得分,以及衡量遮蔽标记时信息损失的KL散度。该统一设计产生上下文感知的、在因果上可靠的、在语义上可靠的归因。此外,我们引入了一个精选基准数据集,用于系统性评估生成环境中的归因质量。跨多个模型和数据集的经验评估表明,HETA在归因忠诚度和与人类注释的对齐度方面 consistently 优于现有方法,确立了自回归语言模型可解释性的新标准。

关键词

引用

@article{arxiv.2604.13258,
  title  = {Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs},
  author = {Vishal Pramanik and Maisha Maliha and Nathaniel D. Bastian and Sumit Kumar Jha},
  journal= {arXiv preprint arXiv:2604.13258},
  year   = {2026}
}

备注

Accepted at ICLR 2026