中文

大型语言模型可解释性:面向生成可信解释的机会与挑战

计算与语言 2025-10-21 v1

摘要

大型语言模型在自然语言处理领域的下游任务中展现出惊人的性能,但人类难以理解其如何预测下一个 token 或生成内容。此外,这些模型常在预测与推理中出错,称为“幻觉”。这些错误凸显了亟需更好地理解和解释语言模型内部运作机制及其生成预测输出方式的紧迫性。为此,本文聚焦于基于 Transformer 的大型语言模型中的局部可解释性与机制解释性,以促进对此类模型的信任。具体而言,本文作出三大贡献:其一,综述了相关文献中关于局部可解释性与机制解释性的方法与见解;其二,描述了在医疗保健与自动驾驶等两个关键领域的实验研究,分析了此类解释对解释接收者的信任影响;其三,总结当前在大型语言模型可解释性领域尚未解决的问题,并概述了向生成人类对齐、可信解释的机会、关键挑战及未来方向。

关键词

引用

@article{arxiv.2510.17256,
  title  = {Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations},
  author = {Shahin Atakishiyev and Housam K. B. Babiker and Jiayi Dai and Nawshad Farruque and Teruaki Hayashi and Nafisa Sadaf Hriti and Md Abed Rahman and Iain Smith and Mi-Young Kim and Osmar R. Zaïane and Randy Goebel},
  journal= {arXiv preprint arXiv:2510.17256},
  year   = {2025}
}