利用LLM生成的反事实对黑盒NLP模型进行忠实解释
计算与语言
2023-11-23 v2 人工智能
摘要
对NLP系统预测结果的因果解释对于确保安全与建立信任至关重要。然而,现有方法往往难以有效或高效地解释模型预测,且常依赖于特定模型。本文关注与模型无关的解释,提出两种用于反事实(CF)近似的方法。第一种方法是CF生成,即通过提示大型语言模型(LLM)在保持混淆概念不变的情况下改变特定文本概念。该方法被证明非常有效,但在推理时应用LLM代价高昂。因此我们提出第二种基于匹配的方法,该方法在训练时由LLM引导并学习一个专用的嵌入空间。该空间忠实于给定的因果图,并能有效用于识别近似CF的匹配项。在从理论上证明构建忠实解释必须近似CF之后,我们对所提方法进行基准测试,并解释了多个模型,包括拥有数十亿参数的LLM。实证结果表明,CF生成模型作为与模型无关的解释器具有优异性能。此外,我们所需测试时资源少得多的匹配方法也能提供有效解释,超越许多基线方法。我们还发现Top-K技术普遍改善了每一种被测方法。最后,我们展示了LLM在构建模型解释新基准方面的潜力,并随后验证了我们的结论。本工作为高效、准确地解释NLP系统开辟了新途径。
引用
@article{arxiv.2310.00603,
title = {Faithful Explanations of Black-box NLP Models Using LLM-generated Counterfactuals},
author = {Yair Gat and Nitay Calderon and Amir Feder and Alexander Chapanin and Amit Sharma and Roi Reichart},
journal= {arXiv preprint arXiv:2310.00603},
year = {2023}
}