面向生成式语言模型的多层次解释
计算与语言
2025-07-24 v2 人工智能
摘要
尽管大型语言模型(LLMs)越来越多地用于摘要生成和问答等基于上下文的任务,但理解是什么促使 LLM 产生特定响应仍然具有挑战性。我们提出了面向生成式语言模型的多层次解释(MExGen),这是一种为基于上下文的文本生成提供解释的技术。MExGen 为上下文的各个部分分配分数,以量化它们对模型输出的影响。它将 LIME 和 SHAP 等归因方法扩展到用于基于上下文任务的 LLM,这些任务的特点是:(1) 推理成本高,(2) 输入文本长,(3) 输出为文本。我们对用于摘要和问答的基于扰动的归因方法进行了自动化和人工的系统评估。结果表明,我们的框架能够比现有替代方案(包括 LLM 自我解释)提供更忠实的生成输出解释。我们开源了 MExGen 的代码,作为 ICX360 工具包的一部分:https://github.com/IBM/ICX360。
引用
@article{arxiv.2403.14459,
title = {Multi-Level Explanations for Generative Language Models},
author = {Lucas Monteiro Paes and Dennis Wei and Hyo Jin Do and Hendrik Strobelt and Ronny Luss and Amit Dhurandhar and Manish Nagireddy and Karthikeyan Natesan Ramamurthy and Prasanna Sattigeri and Werner Geyer and Soumya Ghosh},
journal= {arXiv preprint arXiv:2403.14459},
year = {2025}
}
备注
Accepted as an oral presentation at ACL 2025. Code available at https://github.com/IBM/ICX360