无查询,无访问
计算与语言
2025-08-11 v2 人工智能
摘要
文本对抗攻击通过微妙地修改文本来误导 NLP 模型,包括大型语言模型(LLM)。虽然有效,但现有攻击通常需要了解受害者模型、大量查询或访问训练数据,这限制了现实世界的可行性。为了克服这些限制,我们引入了**基于受害者数据的对抗攻击(VDBA)**,该攻击仅使用受害者文本进行操作。为了防止访问受害者模型,我们使用公开可用的预训练模型和聚类方法创建一个影子数据集,作为开发替代模型的基础。为了解决由于信息反馈不足导致的攻击成功率(ASR)低的问题,我们提出了分层替代模型设计,生成多个替代模型以缓解单个替代模型在决策边界处的失败。同时,我们使用多样化的对抗样本生成方法,采用各种攻击方法生成并选择具有更好相似性和攻击效果的对抗样本。在 Emotion 和 SST5 数据集上的实验表明,VDBA 优于最先进的方法,在将攻击查询显著减少到 0 的同时,实现了 52.08% 的攻击成功率提升。更重要的是,我们发现 VDBA 对 Qwen2 和 GPT 系列等大型语言模型构成了显著威胁,即使在没有访问 API 的情况下,也达到了 45.99% 的最高攻击成功率,这证实了先进的 NLP 模型仍然面临严重的安全风险。我们的代码可在 https://anonymous.4open.science/r/VDBA-Victim-Data-based-Adversarial-Attack-36EC/ 找到。
引用
@article{arxiv.2505.07258,
title = {No Query, No Access},
author = {Wenqiang Wang and Siyuan Liang and Yangshijie Zhang and Xiaojun Jia and Hao Lin and Xiaochun Cao},
journal= {arXiv preprint arXiv:2505.07258},
year = {2025}
}