中文

引导大语言模型生成高保真高质量文本分类反事实解释

计算与语言 2025-12-11 v2

摘要

深度学习可解释性的需求推动了反事实解释的研究兴趣,反事实解释旨在识别改变模型预测所需的最小实例变更。当前反事实生成方法需要任务特定的微调,且生成文本质量较低。大语言模型(LLMs)虽然擅长高质量文本生成,但在没有微调的情况下难以生成标签翻转反事实(即改变预测的反事实)。我们引入两种简单的分类器引导方法来支持 LLMs 的反事实生成,无需微调同时保留 LLMs 的优势。尽管方法简单,我们的方法优于最先进的反事实生成方法,并在不同 LLMs 上均有效,凸显了利用分类器信息引导 LLMs 反事实生成的好处。我们进一步证明,通过我们生成的反事实进行数据增强可以提升分类器的鲁棒性。我们的分析揭示了 LLMs 反事实生成中的一个关键问题:LLMs 依赖参数化知识而非忠实遵循分类器。

关键词

引用

@article{arxiv.2503.04463,
  title  = {Guiding LLMs to Generate High-Fidelity and High-Quality Counterfactual Explanations for Text Classification},
  author = {Van Bach Nguyen and Christin Seifert and Jörg Schlötterer},
  journal= {arXiv preprint arXiv:2503.04463},
  year   = {2025}
}