ReinforceBug:一种生成对抗性文本示例的框架
机器学习
2021-03-16 v1 人工智能
摘要
通过对原始训练示例进行扰动而生成的对抗性示例(AEs)有助于提升基于深度学习(DL)的模型的鲁棒性。大多数先前工作生成的 AEs 或因词法错误而不可信,或在语义或功能上偏离原始示例。在本文中,我们提出 ReinforceBug,一种强化学习框架,其学习一种在未见数据集上可迁移的策略,并生成保持效用且可迁移(至其他模型)的 AEs。我们的结果表明,与最先进的攻击方法 TextFooler 相比,我们的方法平均成功率高出 10%。此外,目标模型对错误预测的平均置信度为 73.64%,所生成的 AEs 与其原始对应项保持功能等价性和语义相似性(83.38%),并且在其他模型上可迁移,平均成功率为 46%。
引用
@article{arxiv.2103.08306,
title = {ReinforceBug: A Framework to Generate Adversarial Textual Examples},
author = {Bushra Sabir and M. Ali Babar and Raj Gaire},
journal= {arXiv preprint arXiv:2103.08306},
year = {2021}
}
备注
Accepted in NAACL-HLT 2021