SPEX:面向 LLM 的特征交互解释缩放方法
机器学习
2025-02-20 v1 人工智能
计算与语言
信息论
math.IT
摘要
大型语言模型(LLMs)凭借其捕获输入特征间复杂交互的能力,彻底改变了机器学习。流行的后验解释方法(如 SHAP)提供边际特征归因,而它们向交互重要性的扩展仅能缩放至较小的输入长度(约 20)。我们提出了 Spectral Explainer(SPEX),这是一种模型无关的交互归因算法,能够高效缩放至大输入长度(约 1000)。SPEX 利用交互间潜在的自然稀疏性(这在真实世界数据中很常见),并应用使用信道解码算法的稀疏傅里叶变换来高效识别重要交互。我们在三个困难的长上下文数据集上进行了实验,这些数据集需要 LLMs 利用输入间的交互来完成任务。对于大输入,SPEX 在忠实重建 LLM 输出方面比边际归因方法高出 20%。此外,SPEX 成功识别了对模型输出有强烈影响的关键特征和交互。对于我们其中一个数据集 HotpotQA,SPEX 提供的交互与人工标注相一致。最后,我们使用这种模型无关的方法生成解释,以展示闭源 LLMs(GPT-4o mini)中的抽象推理以及视觉语言模型中的组合推理。
引用
@article{arxiv.2502.13870,
title = {SPEX: Scaling Feature Interaction Explanations for LLMs},
author = {Justin Singh Kang and Landon Butler and Abhineet Agarwal and Yigit Efe Erginbas and Ramtin Pedarsani and Kannan Ramchandran and Bin Yu},
journal= {arXiv preprint arXiv:2502.13870},
year = {2025}
}