Adversarial GLUE:用于语言模型鲁棒性评估的多任务基准
计算与语言
2022-01-11 v2 密码学与安全
机器学习
摘要
大规模预训练语言模型在广泛的自然语言理解(NLU)任务中取得了巨大成功,甚至超越了人类表现。然而,最近的研究表明,这些模型的鲁棒性会受到精心构造的文本对抗样本的挑战。尽管已有几个单独的数据集被提出用于评估模型鲁棒性,但仍缺乏一个原则性且全面的基准。在本文中,我们提出了 Adversarial GLUE(AdvGLUE),这是一个新的多任务基准,旨在定量且全面地探索和评估现代大规模语言模型在各种类型对抗攻击下的脆弱性。具体而言,我们系统地应用了 14 种文本对抗攻击方法到 GLUE 任务中以构建 AdvGLUE,并进一步由人工验证以确保标注的可靠性。我们的发现总结如下: 大多数现有的对抗攻击算法容易生成无效或模棱两可的对抗样本,其中约 90% 的样本要么改变了原始语义,要么也会误导人类标注员。因此,我们执行了仔细的过滤过程,以构建一个高质量的基准。 我们测试的所有语言模型和鲁棒训练方法在 AdvGLUE 上表现均不佳,得分远落后于良性准确率。我们希望我们的工作能推动开发更隐蔽且保持语义的新对抗攻击方法,以及抵御复杂对抗攻击的新鲁棒语言模型。AdvGLUE 可在 https://adversarialglue.github.io 获取。
引用
@article{arxiv.2111.02840,
title = {Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models},
author = {Boxin Wang and Chejian Xu and Shuohang Wang and Zhe Gan and Yu Cheng and Jianfeng Gao and Ahmed Hassan Awadallah and Bo Li},
journal= {arXiv preprint arXiv:2111.02840},
year = {2022}
}
备注
Oral Presentation in NeurIPS 2021 (Datasets and Benchmarks Track). 24 pages, 4 figures, 12 tables