开源文本分类模型及其微调链的对抗鲁棒性
软件工程
2024-08-07 v1
摘要
背景:随着人工智能技术和应用的发展,已开发出大量AI模型,催生了像Hugging Face(HF)这样的开源模型托管平台。感谢这些平台,用户可以直接下载和使用模型,以及对其进行微调以构建更具特定领域的模型。然而,正如传统软件供应链面临安全风险,AI模型及其通过微调形成的供应链也面临新的安全风险,如对抗攻击。因此,开源模型的对抗鲁棒性引起了广泛关注,可能影响人们对开源模型的选择。目标:本文旨在探索开源AI模型及其通过微调形成的上下游关系链的对抗鲁棒性,以提供有关潜在对抗风险的见解。方法:我们收集HF上的文本分类模型并构建微调链。然后,在现有对抗攻击下,从模型和其微调链两个方面对模型重用及相关鲁棒性风险进行经验性分析。结果:尽管这些模型被广泛下载和重用,但总体上容易受到对抗攻击风险,平均攻击成功率为52.70%。此外,微调通常会加剧这一风险,导致攻击成功率平均增加12.60%。我们还深入研究了攻击技术、数据集和模型架构对成功率的影响,以及沿模型链的传递性。
引用
@article{arxiv.2408.02963,
title = {Adversarial Robustness of Open-source Text Classification Models and Fine-Tuning Chains},
author = {Hao Qin and Mingyang Li and Junjie Wang and Qing Wang},
journal= {arXiv preprint arXiv:2408.02963},
year = {2024}
}