从对抗军备竞赛到以模型为中心的评估:构建统一自动鲁棒性评估框架的动机
计算与语言
2023-05-31 v1 密码学与安全
机器学习
摘要
文本对抗攻击可通过在输入中添加语义保持但具误导性的扰动来发现模型的弱点。自然语言处理(NLP)中长期的对抗攻防军备竞赛以算法为中心,为自动鲁棒性评估提供了有价值的技术。然而,现有的鲁棒性评估实践可能存在评估不全面、评估协议不切实际以及对抗样本无效等问题。在本文中,我们旨在建立一个统一的自动鲁棒性评估框架,转向以模型为中心的评估,以进一步利用对抗攻击的优势。为应对上述挑战,我们首先基于模型能力确定鲁棒性评估维度,并为每个维度指定生成对抗样本的合理算法。随后,我们在实际需求下建立包括评估设置与指标在内的评估协议。最后,我们利用对抗样本的扰动程度来控制样本有效性。我们实现了一个工具包 RobTest 来落实我们的自动鲁棒性评估框架。在实验中,我们对 RoBERTa 模型进行鲁棒性评估以证明我们评估框架的有效性,并进一步展示框架中各组件的合理性。代码将在 \url{https://github.com/thunlp/RobTest} 公开。
引用
@article{arxiv.2305.18503,
title = {From Adversarial Arms Race to Model-centric Evaluation: Motivating a Unified Automatic Robustness Evaluation Framework},
author = {Yangyi Chen and Hongcheng Gao and Ganqu Cui and Lifan Yuan and Dehan Kong and Hanlu Wu and Ning Shi and Bo Yuan and Longtao Huang and Hui Xue and Zhiyuan Liu and Maosong Sun and Heng Ji},
journal= {arXiv preprint arXiv:2305.18503},
year = {2023}
}
备注
Accepted to Findings of ACL 2023