统一模型可解释性与鲁棒性的联合文本分类与理由抽取
计算与语言
2021-12-21 v1 人工智能
摘要
近期工作表明可解释性和鲁棒性是可信赖且可靠的文本分类的两个关键要素。然而,以往工作通常只解决以下两个方面之一:i) 如何抽取准确的理由以实现可解释性,同时有益于预测;ii) 如何使预测模型对不同类型的对抗攻击具有鲁棒性。直观上,能够给出有用解释的模型应当对抗对抗攻击更具鲁棒性,因为我们无法信任一个输出解释却在小扰动下改变预测的模型。为此,我们提出一种名为AT-BMC的联合分类与理由抽取模型。它包含两种关键机制:混合对抗训练(AT)旨在利用离散和嵌入空间中的多种扰动来提升模型的鲁棒性,边界匹配约束(BMC)借助边界信息引导以更精确地定位理由。在基准数据集上的性能表明,所提出的AT-BMC在分类和理由抽取上均以较大优势优于基线。鲁棒性分析显示,所提出的AT-BMC将攻击成功率有效降低了至多69%。实证结果表明,鲁棒模型与更好的解释之间存在联系。
引用
@article{arxiv.2112.10424,
title = {Unifying Model Explainability and Robustness for Joint Text Classification and Rationale Extraction},
author = {Dongfang Li and Baotian Hu and Qingcai Chen and Tujie Xu and Jingcong Tao and Yunan Zhang},
journal= {arXiv preprint arXiv:2112.10424},
year = {2021}
}
备注
AAAI 2022