用另一个黑箱解释黑箱是否合理?
计算与语言
2024-04-24 v1 机器学习
摘要
虽然反事实解释是解释 ML 黑箱分类器的流行方法,但在 NLP 领域应用较少。大多数方法通过迭代扰动目标文档,直到被黑箱模型不同地分类来找到这些解释。我们在文献中识别了两种主要的反事实解释方法,即(a)透明方法通过添加、删除或替换单词来扰动目标,和(b)不透明方法将目标文档投影到潜在的、不可解释的空间中,随后进行扰动。本文对这两种方法在三个经典 NLP 任务上的性能进行比较研究。我们的实证证据表明,不透明方法对于下游应用(如虚假新闻检测或情感分析)可能是多余的,因为它们在复杂性上增加了一层额外的层次,而未获得显著的性能提升。这些观察激发了我们的讨论,提出了这样一个问题:是否合理地用另一个黑箱来解释黑箱?
引用
@article{arxiv.2404.14943,
title = {Does It Make Sense to Explain a Black Box With Another Black Box?},
author = {Julien Delaunay and Luis Galárraga and Christine Largouët},
journal= {arXiv preprint arXiv:2404.14943},
year = {2024}
}
备注
This article was originally published in French at the Journal TAL. VOL 64 n{\deg}3/2023. arXiv admin note: substantial text overlap with arXiv:2402.10888