LIME-LLM:用流畅的反事实文本而非破碎文本探测模型
计算与语言
2026-01-21 v1 人工智能
机器学习
摘要
LIME(Ribeiro 等,2016)等局部解释方法仍是可信人工智能的基础,但其在自然语言处理中的应用受限于对随机词元掩码的依赖。这些启发式扰动经常生成语义无效、分布外输入,从而削弱局部代理模型的保真度。尽管最近的生成式方法(如 LLiMe,Angiulli 等,2025b)尝试通过使用大语言模型进行邻域生成来缓解此问题,但它们依赖无约束的释义,引入了混杂变量,使得隔离特定特征贡献变得困难。我们提出了 LIME-LLM,一个用假设驱动、受控扰动替代随机噪声的框架。通过强制执行严格的“单掩码-单样本”协议,并采用独特的中性填充和边界填充策略,LIME-LLM 构建了流畅、在流形上的邻域,从而严格隔离特征效应。我们在三个不同的基准数据集(CoLA、SST-2 和 HateXplain)上,使用人工标注的理由作为真实依据,将我们的方法与已建立的基线(LIME、SHAP、Integrated Gradients)以及生成式 LLiMe 基线进行了评估。实证结果表明,LIME-LLM 为黑盒 NLP 可解释性建立了新基准,与传统的基于扰动的方法和最近的生成式替代方案相比,在局部解释保真度上取得了显著提升。
引用
@article{arxiv.2601.11746,
title = {LIME-LLM: Probing Models with Fluent Counterfactuals, Not Broken Text},
author = {George Mihaila and Suleyman Olcay Polat and Poli Nemkova and Himanshu Sharma and Namratha V. Urs and Mark V. Albert},
journal= {arXiv preprint arXiv:2601.11746},
year = {2026}
}