中文

通过因果干预实现针对自然语言攻击的认证鲁棒性

机器学习 2022-10-18 v3 计算与语言 密码学与安全

摘要

深度学习模型已在诸多领域取得巨大成功,但它们易受对抗样本的影响。本文从因果视角审视对抗脆弱性,并提出语义平滑因果干预(CISS),一种面向抵御自然语言攻击鲁棒性的新框架。CISS 并非仅拟合观测数据,而是通过潜语义空间中的平滑来学习因果效应 p(y|do(x)) 以做出鲁棒预测,该方法可扩展至深度架构,并避免了为特定攻击繁琐地构造噪声。CISS 在理论上可证明对词替换攻击具有鲁棒性,并且在扰动被未知攻击算法加强时也具有经验鲁棒性。例如,在 YELP 上,CISS 在针对词替换的认证鲁棒性方面超越亚军 6.7%,并在融入句法攻击时达到 79.4% 的经验鲁棒性。

关键词

引用

@article{arxiv.2205.12331,
  title  = {Certified Robustness Against Natural Language Attacks by Causal Intervention},
  author = {Haiteng Zhao and Chang Ma and Xinshuai Dong and Anh Tuan Luu and Zhi-Hong Deng and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2205.12331},
  year   = {2022}
}