中文

TextGenSHAP:长文档文本生成中的可扩展事后解释

计算与语言 2023-12-05 v1 人工智能 机器学习

摘要

大型语言模型(LLM)因其日益准确的回答和连贯的推理能力而在实际应用中引起了巨大兴趣。鉴于其作为黑盒使用复杂推理过程处理输入的本质,对 LLM 生成内容进行可扩展且忠实的解释的需求必将持续增长。在过去十年中,神经网络模型的可解释性取得了重大进展。其中,事后可解释性方法,尤其是 Shapley 值,已被证明对解释深度学习模型非常有效。然而,将 Shapley 值应用于 LLM 存在重大挑战,特别是在处理包含数千个 token 的长输入上下文和自回归生成的输出序列时。此外,如何有效利用生成的解释来提高 LLM 的性能往往也不明确。在本文中,我们介绍了 TextGenSHAP,这是一种结合了 LM 特定技术的高效事后解释方法。我们证明,与传统的 Shapley 值计算相比,这带来了显著的加速,将 token 级解释的处理时间从数小时缩短至数分钟,将文档级解释缩短至数秒。此外,我们演示了如何在两个重要场景中利用实时 Shapley 值:通过定位重要的单词和句子来更好地理解长文档问答;以及通过提高所选段落的准确性并最终提高最终回答的准确性来改进现有的文档检索系统。

关键词

引用

@article{arxiv.2312.01279,
  title  = {TextGenSHAP: Scalable Post-hoc Explanations in Text Generation with Long Documents},
  author = {James Enouen and Hootan Nakhost and Sayna Ebrahimi and Sercan O Arik and Yan Liu and Tomas Pfister},
  journal= {arXiv preprint arXiv:2312.01279},
  year   = {2023}
}