中文

面向文本分类的忠实解释:结合鲁棒性提升与解释引导训练

计算与语言 2024-01-01 v1

摘要

特征归因方法通过突出重要的输入标记作为模型预测的解释,已广泛应用于深度神经网络以实现可信AI。然而,近期研究表明这些方法提供的解释在忠实性和鲁棒性方面面临挑战。本文提出一种结合鲁棒性提升与解释引导训练的方法(REGEX),旨在为文本分类提供更忠实的解释。首先,我们通过输入梯度正则化技术和虚拟对抗训练提升模型鲁棒性。其次,我们使用显著性排序来掩盖噪声标记,并最大化模型注意力与特征归因之间的相似性,这可以视为一种无需引入外部信息的自训练过程。我们在六个数据集上使用五种归因方法进行了广泛实验,并在域外设置下评估了忠实性。结果表明,REGEX在所有设置下均提升了解释的保真度指标,并通过两种随机化测试取得了一致改进。此外,我们展示了使用REGEX生成的突出解释来训练“先选择后预测”模型,其任务性能与端到端方法相当。

关键词

引用

@article{arxiv.2312.17591,
  title  = {Towards Faithful Explanations for Text Classification with Robustness Improvement and Explanation Guided Training},
  author = {Dongfang Li and Baotian Hu and Qingcai Chen and Shan He},
  journal= {arXiv preprint arXiv:2312.17591},
  year   = {2024}
}