失去耐心的 BERT 将无法抵御对抗性减速
机器学习
2023-11-01 v2 计算与语言
密码学与安全
摘要
本文中,我们系统评估多出口语言模型抵御对抗性减速的鲁棒性。为审查其鲁棒性,我们设计了一种生成自然对抗文本以绕过早退出点的减速攻击。我们利用所得的 WAFFLE 攻击作为工具,基于 GLUE 基准对三种多出口机制针对对抗性减速进行全面评估。随后我们表明,该攻击在白盒与黑盒设定下均显著削减了这三种方法所提供的计算节省。机制越复杂,越易遭受对抗性减速。我们还对扰动文本输入做了语言学分析,识别出攻击生成的常见扰动模式,并与标准对抗文本攻击比较。此外,我们展示对抗训练无法有效击败我们的减速攻击,但使用对话模型(如 ChatGPT)的输入净化可高效移除扰动。该结果表明,未来需致力于开发高效且鲁棒的多出口模型。我们的代码见:https://github.com/ztcoalson/WAFFLE
引用
@article{arxiv.2310.19152,
title = {BERT Lost Patience Won't Be Robust to Adversarial Slowdown},
author = {Zachary Coalson and Gabriel Ritter and Rakesh Bobba and Sanghyun Hong},
journal= {arXiv preprint arXiv:2310.19152},
year = {2023}
}
备注
Accepted to NeurIPS 2023 [Poster]