大语言模型中稀疏特征交互推理的 ProxySPEX
机器学习
2025-10-27 v2 人工智能
计算与语言
摘要
大型语言模型(LLM)通过捕获输入特征之间的复杂交互作用实现了显著的性能。为了识别这些交互作用,大多数现有方法需要枚举所有可能的特征组合,直到给定的阶数,从而随特征数量n的增大而规模化。最近,Kang等人(2025)提出了SPEX,这是一种基于信息论的方法,使用交互稀疏性扩展到n≈10^3的特征。SPEX在先前方法的基础上大幅提高了性能,但需要数万次模型推理,这对于大型模型来说可能是不可行的。在本文中,我们观察到LLM特征交互往往是层次化的——更高阶的交互伴随其更低阶子集,这使得更高效的发现成为可能。为了利用这种层次结构,我们提出了ProxySPEX,这是一种交互归因算法,首先对被掩码LLM输出拟合梯度提升树,然后提取重要交互。在四个具有挑战性的高维数据集上进行的实验表明,ProxySPEX通过20%地更忠实地重建LLM输出,同时使用比SPEX少10倍的推理次数。通过考虑交互作用,ProxySPEX能够高效地识别最具影响力的特征,为它们的Shapley值提供了可扩展的近似。此外,我们将ProxySPEX应用于两个可解释性任务。其中一种是数据归因,我们识别影响CIFAR-10训练样本测试预测的交互作用;另一种是机制可解释性,我们在问答任务上揭示了注意力头之间的交互作用,包括同一层内和跨层的交互。
引用
@article{arxiv.2505.17495,
title = {ProxySPEX: Inference-Efficient Interpretability via Sparse Feature Interactions in LLMs},
author = {Landon Butler and Abhineet Agarwal and Justin Singh Kang and Yigit Efe Erginbas and Bin Yu and Kannan Ramchandran},
journal= {arXiv preprint arXiv:2505.17495},
year = {2025}
}
备注
Algorithm available at: https://github.com/mmschlk/shapiq