通过因果干预实现针对自然语言攻击的认证鲁棒性
机器学习
2022-10-18 v3 计算与语言
密码学与安全
摘要
深度学习模型已在诸多领域取得巨大成功,但它们易受对抗样本的影响。本文从因果视角审视对抗脆弱性,并提出语义平滑因果干预(CISS),一种面向抵御自然语言攻击鲁棒性的新框架。CISS 并非仅拟合观测数据,而是通过潜语义空间中的平滑来学习因果效应 p(y|do(x)) 以做出鲁棒预测,该方法可扩展至深度架构,并避免了为特定攻击繁琐地构造噪声。CISS 在理论上可证明对词替换攻击具有鲁棒性,并且在扰动被未知攻击算法加强时也具有经验鲁棒性。例如,在 YELP 上,CISS 在针对词替换的认证鲁棒性方面超越亚军 6.7%,并在融入句法攻击时达到 79.4% 的经验鲁棒性。
引用
@article{arxiv.2205.12331,
title = {Certified Robustness Against Natural Language Attacks by Causal Intervention},
author = {Haiteng Zhao and Chang Ma and Xinshuai Dong and Anh Tuan Luu and Zhi-Hong Deng and Hanwang Zhang},
journal= {arXiv preprint arXiv:2205.12331},
year = {2022}
}