通过区间界限传播实现针对符号替换的已验证鲁棒性
计算与语言
2019-12-23 v2 密码学与安全
机器学习
机器学习
摘要
神经网络是许多当代 NLP 系统的组成部分,然而它们的经验性成功是以对对抗攻击的脆弱性为代价的。先前的工作使用对抗训练和数据增强来部分缓解这种脆弱性,但由于离散文本扰动产生的搜索空间复杂性,这些方法不太可能找到最坏情况对手。在这项工作中,我们从相反的方向处理该问题:形式化地验证系统针对预定义类别对抗攻击的鲁棒性。我们研究在同义词替换或字符翻转扰动下的文本分类。我们建议将这些输入扰动建模为一个单纯形,然后使用区间界限传播(Interval Bound Propagation)——一种形式化模型验证方法。我们修改传统的对数似然训练目标,以训练可被高效验证的模型,否则将带来指数级搜索复杂度。所得模型在名义准确率方面仅表现出微小差异,但在扰动下具有大幅改善的已验证准确率,并附带关于最坏情况对手的可高效计算的形式化保证。
引用
@article{arxiv.1909.01492,
title = {Achieving Verified Robustness to Symbol Substitutions via Interval Bound Propagation},
author = {Po-Sen Huang and Robert Stanforth and Johannes Welbl and Chris Dyer and Dani Yogatama and Sven Gowal and Krishnamurthy Dvijotham and Pushmeet Kohli},
journal= {arXiv preprint arXiv:1909.01492},
year = {2019}
}
备注
EMNLP 2019