中文

寻找训练数据与Transformer文本模型对抗鲁棒性之间相关性的好奇案例

机器学习 2024-07-03 v2 计算与语言 密码学与安全

摘要

现有工作表明,微调后的文本Transformer模型实现了最先进的预测性能,但也容易受到对抗性文本扰动的影响。传统的对抗性评估通常仅在模型微调后进行,而忽略了训练数据。在本文中,我们旨在证明训练数据与模型鲁棒性之间也存在强相关性。为此,我们提取了13个代表输入微调语料库各种属性的不同特征,并用它们来预测微调后模型的对抗鲁棒性。我们主要关注仅编码器的Transformer模型BERT和RoBERTa,并补充了BART、ELECTRA和GPT2的结果,提供了多样化的证据来支持我们的论点。首先,实证分析表明:(a) 提取的特征可以与轻量级分类器(如随机森林)一起使用,有效预测攻击成功率;(b) 对模型鲁棒性影响最大的特征与鲁棒性具有明确的相关性。其次,我们的框架可以作为快速有效的鲁棒性评估附加工具,因为它 (a) 与传统技术相比节省了30倍至193倍的运行时间,(b) 可跨模型迁移,(c) 可在对抗训练下使用,(d) 对统计随机性具有鲁棒性。我们的代码公开在 \url{https://github.com/CaptainCuong/RobustText_ACL2024}。

关键词

引用

@article{arxiv.2402.11469,
  title  = {A Curious Case of Searching for the Correlation between Training Data and Adversarial Robustness of Transformer Textual Models},
  author = {Cuong Dang and Dung D. Le and Thai Le},
  journal= {arXiv preprint arXiv:2402.11469},
  year   = {2024}
}

备注

Accepted to ACL Findings 2024