中文

NormXLogit:标题即正义

计算与语言 2025-08-19 v2

摘要

随着新型大语言模型(LLM)不断涌现,考虑模型无关方法的潜在价值以在各种架构上提供可解释性尤为重要。尽管近期在 LLM 可解释性方面的进展显示出前景,但许多方法依赖于复杂的、针对特定模型的方法,计算成本高昂。为克服这些限制,我们提出了 NormXLogit,这是一种用于评估单个输入 token 重要性的新技术。该方法基于与每个 token 相关的输入和输出表示。首先,我们展示在 LLM 预训练期间,词嵌入的范数能够有效捕获 token 的重要性。其次,我们揭示了 token 重要性与其表示能否接近模型最终预测程度之间的显著关系。广泛的分析表明,我们的方法在忠诚度方面优于现有的基于梯度的方法,并在层级解释方面表现出竞争力,优于领先的架构特定技术。

关键词

引用

@article{arxiv.2411.16252,
  title  = {NormXLogit: The Head-on-Top Never Lies},
  author = {Sina Abbasi and Mohammad Reza Modarres and Mohammad Taher Pilehvar},
  journal= {arXiv preprint arXiv:2411.16252},
  year   = {2025}
}

备注

Added comparisons on computational efficiency, included experiments on a new dataset with an additional evaluation metric for classification tasks, expanded explanations and discussions in the experiments, and presented a worked example for alignment metrics computation