中文

通过区间界限传播实现针对符号替换的已验证鲁棒性

计算与语言 2019-12-23 v2 密码学与安全 机器学习 机器学习

摘要

神经网络是许多当代 NLP 系统的组成部分,然而它们的经验性成功是以对对抗攻击的脆弱性为代价的。先前的工作使用对抗训练和数据增强来部分缓解这种脆弱性,但由于离散文本扰动产生的搜索空间复杂性,这些方法不太可能找到最坏情况对手。在这项工作中,我们从相反的方向处理该问题:形式化地验证系统针对预定义类别对抗攻击的鲁棒性。我们研究在同义词替换或字符翻转扰动下的文本分类。我们建议将这些输入扰动建模为一个单纯形,然后使用区间界限传播(Interval Bound Propagation)——一种形式化模型验证方法。我们修改传统的对数似然训练目标,以训练可被高效验证的模型,否则将带来指数级搜索复杂度。所得模型在名义准确率方面仅表现出微小差异,但在扰动下具有大幅改善的已验证准确率,并附带关于最坏情况对手的可高效计算的形式化保证。

关键词

引用

@article{arxiv.1909.01492,
  title  = {Achieving Verified Robustness to Symbol Substitutions via Interval Bound Propagation},
  author = {Po-Sen Huang and Robert Stanforth and Johannes Welbl and Chris Dyer and Dani Yogatama and Sven Gowal and Krishnamurthy Dvijotham and Pushmeet Kohli},
  journal= {arXiv preprint arXiv:1909.01492},
  year   = {2019}
}

备注

EMNLP 2019