中文

关于大型语言模型可解释性的问题与词级单变量一阶 plausibility 假设

计算与语言 2024-03-18 v1 人工智能

摘要

大型语言模型的解释最近被显示出对其训练所使用的随机性敏感,这就导致需要描述这种敏感性。本文提出了一种描述方法,对这种可能性提供了简单且富有信息量的解释的可能性进行了质疑。为此,我们给出解释信号、噪声及信噪比的统计定义。我们指出,在典型案例研究中,对一阶统计工具分析词级单变量解释时,简单基于特征的模型的解释比变换器模型的解释更有信号、更少噪声。随后,我们讨论了通过捕捉更复杂解释和分析方法的替代定义来改进这些结果的可能性,同时也对这些解释的可解释性与读者之间的 tradeoff 进行了质疑。

关键词

引用

@article{arxiv.2403.10275,
  title  = {A Question on the Explainability of Large Language Models and the Word-Level Univariate First-Order Plausibility Assumption},
  author = {Jeremie Bogaert and Francois-Xavier Standaert},
  journal= {arXiv preprint arXiv:2403.10275},
  year   = {2024}
}

备注

7 pages, 10 figures, Accepted and presented at AAAI 2024 (ReLM workshop)