TokenSHAP:基于蒙特卡洛Sherpley值估计的大语言模型解释
计算与语言
2024-07-23 v2
摘要
随着大语言模型 (LLMs) 在关键应用中变得越来越普遍,对可解释 AI 的需求日益增长。我们提出了 TokenSHAP 方法,通过对输入提示中 individual token 或子串的重要性进行归因来解释 LLMs。该方法将合作博弈论中的 Sherpley 值应用于自然语言处理,提供了一种严谨的框架,用于理解不同输入部分如何贡献于模型响应。TokenSHAP 利用蒙特卡洛抽样实现计算效率,提供可解释的、量化的 token 重要性度量。我们在 diverse prompts 和 LLM 架构上展示了其有效性,显示在与人类判断一致性、忠于模型行为和一致性方面均显著优于现有基线。我们的方法能够捕捉 token 之间细微的相互作用,为 LLM 行为提供宝贵的见解,增强模型透明度,改进提示工程,并有助于开发更可靠的 AI 系统。TokenSHAP 代表了对负责任 AI 部署所需可解释性的重要一步,为创建更透明、可持证和可信赖的 AI 系统的更广泛目标做出了贡献。
引用
@article{arxiv.2407.10114,
title = {TokenSHAP: Interpreting Large Language Models with Monte Carlo Shapley Value Estimation},
author = {Roni Goldshmidt and Miriam Horovicz},
journal= {arXiv preprint arXiv:2407.10114},
year = {2024}
}