评估神经机器理解模型对噪声输入与对抗攻击的鲁棒性
计算与语言
2020-05-04 v1
摘要
我们通过在字符、词和句子层面进行新颖扰动,评估机器理解模型对噪声与对抗攻击的鲁棒性。我们尝试不同数量的扰动以检验模型置信度与误分类率,并对比了两种基准数据集上采用不同嵌入类型的对抗训练中的模型性能。我们展示了通过集成提升模型性能。最后,我们分析了影响对抗训练下模型行为的因素,并开发了一个模型来预测对抗攻击期间的模型错误。
引用
@article{arxiv.2005.00190,
title = {Evaluating Neural Machine Comprehension Model Robustness to Noisy Inputs and Adversarial Attacks},
author = {Winston Wu and Dustin Arendt and Svitlana Volkova},
journal= {arXiv preprint arXiv:2005.00190},
year = {2020}
}