RoPE-LIME: 基于RoPE空间局部性+稀疏K抽样的高效LLM归因
计算与语言
2026-02-20 v2
摘要
解释封闭源大型语言模型(LLM)的输出具有挑战性,因为API访问限制了基于梯度的归因方法,而扰动方法在依赖再生成文本的情况下成本高昂且噪声大。我们提出\textbf{旋转位置嵌入线性局部可解释模型无关解释(RoPE-LIME)},这是gSMILE的一个开源扩展,解耦推理与解释:给定来自封闭模型的固定输出,较小的开源替代模型可从基于概率的目标(负对数似然和散度目标)下,对输入扰动计算出基于token的归因。RoPE-LIME融合了(i)基于在RoPE嵌入空间中计算的放宽词语移动距离(Relaxed Word Mover's Distance)的局部性核,以实现掩码下的稳定相似性,以及(ii)稀疏K抽样,这是一种在有限预算下提高交互覆盖率的高效扰动策略。在HotpotQA(句子特征)和手标注MMLU子集(词语特征)上的实验表明,RoPE-LIME比离子去除抽样产生更具信息性的归因,gSMILE也在显著减少封闭模型API调用方面取得改进。
引用
@article{arxiv.2602.06275,
title = {RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution},
author = {Isaac Picov and Ritesh Goru},
journal= {arXiv preprint arXiv:2602.06275},
year = {2026}
}