引导大语言模型生成高保真高质量文本分类反事实解释
计算与语言
2025-12-11 v2
摘要
深度学习可解释性的需求推动了反事实解释的研究兴趣,反事实解释旨在识别改变模型预测所需的最小实例变更。当前反事实生成方法需要任务特定的微调,且生成文本质量较低。大语言模型(LLMs)虽然擅长高质量文本生成,但在没有微调的情况下难以生成标签翻转反事实(即改变预测的反事实)。我们引入两种简单的分类器引导方法来支持 LLMs 的反事实生成,无需微调同时保留 LLMs 的优势。尽管方法简单,我们的方法优于最先进的反事实生成方法,并在不同 LLMs 上均有效,凸显了利用分类器信息引导 LLMs 反事实生成的好处。我们进一步证明,通过我们生成的反事实进行数据增强可以提升分类器的鲁棒性。我们的分析揭示了 LLMs 反事实生成中的一个关键问题:LLMs 依赖参数化知识而非忠实遵循分类器。
引用
@article{arxiv.2503.04463,
title = {Guiding LLMs to Generate High-Fidelity and High-Quality Counterfactual Explanations for Text Classification},
author = {Van Bach Nguyen and Christin Seifert and Jörg Schlötterer},
journal= {arXiv preprint arXiv:2503.04463},
year = {2025}
}