NaturalAdversaries:自然主义对抗样本能否与人工对抗样本同样有效?
计算与语言
2022-11-09 v1
摘要
尽管已有大量先前工作探索了自然语言理解任务的对抗样本生成,但这些样本通常不切实际,偏离了真实世界的数据分布。在这项工作中,我们引入了一个两阶段的对抗样本生成框架(NaturalAdversaries),用于设计能有效欺骗给定分类器的对抗样本,并展示在模型实际部署中可能出现的自然失败案例。在第一阶段,使用令牌归因方法将给定分类器的行为总结为输入中关键令牌的函数。在第二阶段,一个生成模型以第一阶段的关键令牌为条件进行生成。NaturalAdversaries 可根据对模型参数的访问级别,适应黑盒和白盒对抗攻击。我们的结果表明,这些对抗样本能跨领域泛化,并为未来研究如何提高神经文本分类模型的鲁棒性提供了见解。
引用
@article{arxiv.2211.04364,
title = {NaturalAdversaries: Can Naturalistic Adversaries Be as Effective as Artificial Adversaries?},
author = {Saadia Gabriel and Hamid Palangi and Yejin Choi},
journal= {arXiv preprint arXiv:2211.04364},
year = {2022}
}
备注
Findings of EMNLP 2022