TextBugger:面向真实世界应用生成对抗性文本
密码学与安全
2018-12-14 v1 计算与语言
机器学习
摘要
基于深度学习的文本理解 (DLTU) 是问答、机器翻译与文本分类等各类应用背后的支撑技术。尽管其极为流行,DLTU 的安全漏洞仍很大程度上未知,鉴于其在情感分析与有害内容检测等安全敏感应用中的日益使用,这令人高度担忧。本文中,我们表明 DLTU 本质上易受对抗性文本攻击,其中被恶意构造的文本会触发目标 DLTU 系统与服务产生错误行为。具体而言,我们提出 TextBugger,一个用于生成对抗性文本的通用攻击框架。与先前工作相比,TextBugger 在重要方面有所不同:(i) 有效——在攻击成功率上优于当前最优攻击;(ii) 规避——保持良性文本的效用,94.9% 的对抗性文本能被人类读者正确识别;(iii) 高效——以相对于文本长度的次线性计算复杂度生成对抗性文本。我们在用于情感分析与有害内容检测的一组真实世界 DLTU 系统与服务上实证评估了 TextBugger,证明了其有效性、规避性与高效性。例如,TextBugger 在基于 Amazon AWS Comprehend 的 IMDB 数据集上以 4.61 秒取得 100% 成功率,并保持 97% 语义相似度。我们进一步讨论了缓解此类攻击的可能防御机制及攻击者的潜在对策,这为后续研究指明了有前景的方向。
引用
@article{arxiv.1812.05271,
title = {TextBugger: Generating Adversarial Text Against Real-world Applications},
author = {Jinfeng Li and Shouling Ji and Tianyu Du and Bo Li and Ting Wang},
journal= {arXiv preprint arXiv:1812.05271},
year = {2018}
}
备注
To appear in NDSS 2019