使用 gSMILE 解释大语言模型
计算与语言
2025-10-22 v5 人工智能
机器学习
摘要
诸如 GPT、LLaMA 和 Claude 等大语言模型(LLM)在文本生成方面取得了卓越的性能,但其决策过程仍不透明,限制了其在高风险应用中的可信度与问责性。我们提出 gSMILE(generative SMILE),一个与模型无关、基于扰动的 LLM 词元级可解释性框架。作为 SMILE 方法的扩展,gSMILE 使用受控的提示扰动、Wasserstein 距离度量和加权线性替代模型,以识别对输出影响最显著的输入词元。该过程能够生成直观的热图,以可视化方式突出显示有影响力的词元和推理路径。我们在领先的 LLM(OpenAI 的 gpt-3.5-turbo-instruct、Meta 的 LLaMA 3.1 Instruct Turbo 和 Anthropic 的 Claude 2.1)上评估了 gSMILE,使用归因保真度、归因一致性、归因稳定性、归因忠实度和归因准确性作为指标。结果表明,gSMILE 提供了可靠的、与人类对齐的归因,其中 Claude 2.1 在注意力保真度方面表现优异,而 GPT-3.5 实现了最高的输出一致性。这些发现证明了 gSMILE 能够平衡模型性能与可解释性,从而实现更透明、更可信的 AI 系统。
引用
@article{arxiv.2505.21657,
title = {Explaining Large Language Models with gSMILE},
author = {Zeinab Dehghani and Mohammed Naveed Akram and Koorosh Aslansefat and Adil Khan and Yiannis Papadopoulos},
journal= {arXiv preprint arXiv:2505.21657},
year = {2025}
}