中文

CELL您的模型:大型语言模型的对比解释

计算与语言 2025-02-18 v3 人工智能 机器学习

摘要

黑箱深度神经网络分类模型的出现催生了对其决策解释的需求。然而,在生成式 AI 场景下,如大型语言模型 (LLM),没有具体的类别预测可解释。相反,可以询问 LLM 为给定提示输出特定响应的原因。在本文中,我们通过提出一种只需黑箱/查询访问即可实现的对比解释方法来回答此问题。我们的解释表明,LLM 输出给定提示的响应是因为如果提示稍微修改,LLM 将输出一个更不可取或与原始响应相矛盾的不同响应。关键洞察是,对比解释只需要一个对用户有意义的评分函数,而不一定是特定的实值数量(即类别标签)。为此,我们提供了一种新的预算化算法,这是我们的主要算法贡献,能够在遵守查询预算的同时,基于此类评分函数智能地创建对比。我们在重要的自然语言任务上展示了该方法的有效性,如开放文本生成和聊天机器人对话。

关键词

引用

@article{arxiv.2406.11785,
  title  = {CELL your Model: Contrastive Explanations for Large Language Models},
  author = {Ronny Luss and Erik Miehling and Amit Dhurandhar},
  journal= {arXiv preprint arXiv:2406.11785},
  year   = {2025}
}