中文

面向动态输出的文本对抗攻击

计算机视觉与模式识别 2025-09-29 v1

摘要

文本对抗攻击方法通常针对具有固定输出标签数量和预定义标签空间的静态场景设计,依赖于对受害模型(基于查询的攻击)或替代模型(基于迁移的攻击)的大量查询。为弥补这一不足,我们提出了文本动态输出攻击(TDOA)方法,该方法采用基于聚类的替代模型训练方法,将动态输出场景转换为静态单输出场景。为提高攻击有效性,我们提出了最远标签定向攻击策略,该策略选择与模型粗粒度标签偏差最大的对抗向量,从而最大化破坏效果。我们在四个数据集和八个受害模型(如 ChatGPT-4o、ChatGPT-4.1)上广泛评估了 TDOA,展示了其在生成对抗样本方面的有效性及其在有限访问条件下破坏大型语言模型的强大潜力。在每次文本仅需一次查询的情况下,TDOA 实现了最高 50.81% 的攻击成功率。此外,我们发现 TDOA 在传统的静态输出场景中也达到了最先进的性能,最高攻击成功率可达 82.68%。同时,通过将翻译任务概念化为具有无界输出空间的分类问题,我们将 TDOA 框架扩展到生成式场景,在 RDBLEU 和 RDchrF 指标上分别超越了先前结果最高达 0.64 和 0.62。

关键词

引用

@article{arxiv.2509.22393,
  title  = {Text Adversarial Attacks with Dynamic Outputs},
  author = {Wenqiang Wang and Siyuan Liang and Xiao Yan and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2509.22393},
  year   = {2025}
}