DARE:面向生物医学与医疗健康应用中鲁棒文本解释的研究
机器学习
2023-07-06 v1 人工智能
摘要
随着深度神经网络在多个应用领域的成功部署,近期对揭示这些网络黑箱性质的需求显著增加。已有多种方法被提出以洞察深度神经网络的推理过程。然而,大多数此类可解释性方法已被证明在图像和通用文本领域面对输入对抗扰动时较为脆弱。在本工作中,我们表明这一现象延伸至生物医学数据集等特定且重要的高风险领域。具体而言,我们观察到解释的鲁棒性应从解释在关联模型输入与其决策方面的准确性——忠实性——以及从领域专家视角看的相关性——合理性——来刻画。这对于防止出现不准确却在本领域语境下看似令人信服的解释至关重要。为此,我们展示了如何将当前的归因鲁棒性估计方法适配到给定领域,以考虑领域特定的合理性。这催生了我们的领域自适应归因鲁棒性估计器(DomainAdaptiveAREstimator, DARE),使我们能够恰当地刻画忠实解释的域特定鲁棒性。接下来,我们提供对抗训练和 FAR 训练两种方法来缓解 DARE 所刻画的脆弱性,从而训练出具有鲁棒归因的网络。最后,我们在三个成熟的生物医学基准上通过大量实验对方法进行了经验验证。
引用
@article{arxiv.2307.02094,
title = {DARE: Towards Robust Text Explanations in Biomedical and Healthcare Applications},
author = {Adam Ivankay and Mattia Rigotti and Pascal Frossard},
journal= {arXiv preprint arXiv:2307.02094},
year = {2023}
}
备注
Accepted at 61st Annual Meeting of the Association for Computational Linguistics (ACL) 2023