超越模型可解释性:论对比性文本解释的忠实度与对抗鲁棒性
计算与语言
2022-10-18 v1 人工智能
人机交互
摘要
对比解释方法超越了透明性,并解决了解释中的对比维度。此类解释正作为一种有吸引力的选项,为受到分类器决策不利影响的场景提供可操作的改变。然而,它们在文本数据上的扩展尚未得到充分探索,且对其漏洞与局限性的研究很少。本文通过构建受解释忠实度启发的新型评估方案,论证了文本反事实的动机。相应地,我们将三个度量——邻近性、连通性与稳定性——的计算扩展到文本数据,并在我们提出的度量上对两种成功的对比方法 POLYJUICE 和 MiCE 进行基准测试。在情感分析数据上的实验表明,两种模型中反事实与其原始对应样本之间的连通性并不明显。更有趣的是,生成的对比文本通过 POLYJUICE 更易获得,这凸显了潜在表示在反事实搜索中的重要性。最后,我们对文本补救方法进行了首次语义对抗攻击。结果表明了 POLYJUICE 的鲁棒性,以及潜在输入表示在鲁棒性与可靠性中所起的作用。
引用
@article{arxiv.2210.08902,
title = {Beyond Model Interpretability: On the Faithfulness and Adversarial Robustness of Contrastive Textual Explanations},
author = {Julia El Zini and Mariette Awad},
journal= {arXiv preprint arXiv:2210.08902},
year = {2022}
}