面向解释鲁棒性的理性化模型对抗攻击
计算与语言
2024-09-20 v3
摘要
理性化模型——选择输入文本的子集作为理由,对人类理解和信任预测至关重要——最近成为可解释人工智能(XAI)领域的一个突出研究方向。然而,大多数先前研究主要关注提升理由的质量,忽略了其对恶意攻击的鲁棒性。具体而言,理性化模型在对抗攻击下是否仍能生成高质量的理由尚不清楚。为探索这一问题,本文提出了UAT2E,旨在不改变其预测的前提下削弱理性化模型的可解释性,从而引发人类用户对这些模型的不信任。UAT2E采用基于梯度的搜索来寻找触发器,然后将其插入原始输入中,以执行非目标攻击和目标攻击。在五个数据集上的实验结果揭示了理性化模型在解释方面的脆弱性,即在攻击下它们倾向于选择更多无意义的标记。基于此,我们提出了一系列提升理性化模型解释能力的建议。
引用
@article{arxiv.2408.10795,
title = {Adversarial Attack for Explanation Robustness of Rationalization Models},
author = {Yuankai Zhang and Lingxiao Kong and Haozhao Wang and Ruixuan Li and Jun Wang and Yuhua Li and Wei Liu},
journal= {arXiv preprint arXiv:2408.10795},
year = {2024}
}