中文

野外对比归因:大语言模型在现实基准测试中的解释性分析

人工智能 2026-04-21 v1 计算与语言

摘要

解释性工具日益增多地用于分析大语言模型(LLM)的失败情况,但先前的工作大多聚焦于短提示或玩具环境,导致对常用基准测试中行为的探讨不足。为弥补这一差距,我们研究了对比式、基于LRP的归因方法作为现实环境下分析LLM失败的实用工具。我们将失败分析表述为“对比归因”,即对错误输出标记与正确备选方案之间的logit差异,对输入标记和内部模型状态进行归因;并引入一种高效扩展,使能够构建用于长上下文输入的跨层归因图。在此框架下,我们跨基准测试进行系统实证研究,比较不同数据集、模型规模和训练检查点之间的归因模式。我们的结果表明,此类标记级对比归因在某些失败案例中可提供有益信号,但并非在所有情况下都适用,这既凸显了其实用性,也揭示了其在现实LLM失败分析中的局限性。我们的代码已公开:https://aka.ms/Debug-XAI。

关键词

引用

@article{arxiv.2604.17761,
  title  = {Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks},
  author = {Rongyuan Tan and Jue Zhang and Zhuozhao Li and Qingwei Lin and Saravan Rajmohan and Dongmei Zhang},
  journal= {arXiv preprint arXiv:2604.17761},
  year   = {2026}
}

备注

45 pages, 16 figures, 16 tables