文本分类器反事实解释方法的比较分析
计算与语言
2024-11-06 v1 人工智能
摘要
反事实解释可用于通过生成最小程度修改的文本输入来改变分类器输出,从而解读和调试文本分类器。在本工作中,我们在两个数据集上使用三种评估指标,评估了五种为BERT文本分类器生成反事实解释的方法。实验结果表明,成熟的白盒替换方法能够有效生成改变分类器输出的有效反事实样本。相比之下,基于大语言模型(LLM)的较新方法在生成自然且语言学上合理的文本反事实方面表现出色,但往往无法生成改变分类器输出的有效反事实。基于这些结果,我们建议开发结合成熟梯度方法优势和较新LLM技术的新反事实解释方法,以生成高质量、有效且合理的文本反事实解释。
引用
@article{arxiv.2411.02643,
title = {A Comparative Analysis of Counterfactual Explanation Methods for Text Classifiers},
author = {Stephen McAleese and Mark Keane},
journal= {arXiv preprint arXiv:2411.02643},
year = {2024}
}
备注
9 pages