迈向透明AI:可解释语言模型综述
计算与语言
2025-09-29 v1
摘要
语言模型(LMs)显著推进了自然语言处理,并在各个领域实现了非凡的进展,然而其黑盒特性引发了对其内部机制和决策过程可解释性的严重关切。这种缺乏透明度的状况在将其应用于高风险领域时尤为棘手,因为在这些领域,利益相关者需要理解模型输出背后的逻辑以确保问责。另一方面,虽然可解释人工智能(XAI)方法在非语言模型上已得到充分研究,但由于语言模型架构复杂、训练语料庞大且泛化能力广泛,XAI 方法在应用于语言模型时面临诸多局限。尽管已有诸多综述探讨了语言模型背景下的 XAI,但它们往往未能捕捉到由这些模型架构多样性和不断演进的能力所带来的独特挑战。为了弥合这一差距,本综述对 XAI 技术进行了全面回顾,特别侧重于语言模型,根据其底层的 Transformer 架构(仅编码器、仅解码器和编码器-解码器)对其进行分类,分析了各方法如何适应每种架构,并评估了其各自的优势与局限。此外,我们通过合理性与忠实性的双重视角评估这些技术,为其有效性提供了结构化的观点。最后,我们指出了开放的研究挑战并概述了有前景的未来方向,旨在引导持续的努力,为语言模型开发鲁棒、透明且可解释的 XAI 方法。
引用
@article{arxiv.2509.21631,
title = {Towards Transparent AI: A Survey on Explainable Language Models},
author = {Avash Palikhe and Zichong Wang and Zhipeng Yin and Rui Guo and Qiang Duan and Jie Yang and Wenbin Zhang},
journal= {arXiv preprint arXiv:2509.21631},
year = {2025}
}