中文

LAMP:从大型语言模型中提取局部决策表面

机器学习 2026-04-28 v3

摘要

我们引入LAMP(Local Attribution Mapping Probe),一种方法用于透视黑箱语言模型的决策表面,研究模型如何可靠地将其自述原因映射到其报告预测。LAMP将模型自报告的解释视为坐标系,拟合局部线性旁近模型以将这些权重与模型输出关联。通过此方法,揭示了明确因素如何引导模型决策。我们将LAMP应用于三个任务:情感分析、争议话题检测和安全提示审计。在这些任务中,LAMP揭示了许多语言模型的局部近似线性决策景观与人类对解释质量的判断一致,并在临床病例文件数据集上与专家评估相吻合。由于LAMP无需访问模型梯度、logits或内部激活,故作为一种实用且轻量级的框架,可用于审计专有语言模型,并评估模型是否似乎行为与其提供的解释一致。

关键词

引用

@article{arxiv.2505.11772,
  title  = {LAMP: Extracting Local Decision Surfaces From Large Language Models},
  author = {Ryan Chen and Youngmin Ko and Zeyu Zhang and Catherine Cho and Sunny Chung and Mauro Giuffré and Dennis L. Shung and Bradly C. Stadie},
  journal= {arXiv preprint arXiv:2505.11772},
  year   = {2026}
}