透明 AI 之路:面向可解释大语言模型的综述
计算与语言
2025-06-30 v1 计算机视觉与模式识别
摘要
大型语言模型 (LLM) 在人工智能领域发挥了关键作用。然而,尽管取得了显著成果,LLM 常常难以解释其决策过程,沦为“黑箱”,成为可解释性领域的重大挑战。这种缺乏透明度构成了在高风险领域应用 LLM 的障碍,而在这些场景中,可解释性尤为关键。为克服这些限制,研究者们发展出各种可解释人工智能 (XAI) 方法,为 LLM 提供人类可理解的解释。然而,对这些方法的系统性认识仍有限。为填补这一空白,本综述基于 LLM 的底层变换器架构(编码器-only、解码器-only 和编码器-解码器模型),对可解释性技术进行了全面归类。随后,我们审视了这些技术在评估可解释性方面的应用,并进一步探讨了这些解释如何在实际应用中被利用。最后,本文讨论了现有资源、持续研究挑战以及未来方向,旨在指引开发透明且负责任 LLM 的持续努力。
引用
@article{arxiv.2506.21812,
title = {Towards Transparent AI: A Survey on Explainable Large Language Models},
author = {Avash Palikhe and Zhenyu Yu and Zichong Wang and Wenbin Zhang},
journal= {arXiv preprint arXiv:2506.21812},
year = {2025}
}