中文

基于动态集成学习的对抗鲁棒性

密码学与安全 2025-05-14 v1 计算与语言

摘要

对抗攻击构成对预训练语言模型(PLMs)如 GPT、BERT、RoBERTa 和 T5 可靠性的重大威胁。本文提出了一种名为 ARDEL(Adversarial Robustness through Dynamic Ensemble Learning)的新型方案,以增强 PLMs 针对此类攻击的鲁棒性。ARDEL 利用多个 PLMs 的多样性,并根据输入特征和检测到的对抗模式动态调整集成配置。ARDEL 的关键组件包括用于动态加权的元模型、对抗模式检测模块以及带正则化技术的对抗训练。使用标准数据集和各种对抗攻击情景进行的全面评估表明,ARDEL 在鲁棒性方面显著优于现有方法。通过动态重新配置集成以针对每个输入优先选择最具鲁棒性的模型,ARDEL 有效降低了攻击成功率,在对抗条件下保持更高的准确率。该工作为开发更安全可信的 AI 系统贡献于更广泛的目标,为实际 NLP 应用提供了一种实用且可扩展的解决方案,以增强 PLMs 的对抗韧性。

关键词

引用

@article{arxiv.2412.16254,
  title  = {Adversarial Robustness through Dynamic Ensemble Learning},
  author = {Hetvi Waghela and Jaydip Sen and Sneha Rakshit},
  journal= {arXiv preprint arXiv:2412.16254},
  year   = {2025}
}

备注

This is the accepted version of our paper for the 2024 IEEE Silchar Subsection Conference (IEEE SILCON24), held from November 15 to 17, 2024, at the National Institute of Technology (NIT), Agartala, India. The paper is 6 pages long and contains 3 Figures and 7 Tables