中文

使用校准的Gumbel-Softmax松弛的通用对抗后缀

计算与语言 2025-12-10 v1

摘要

语言模型(LM)通常通过给标签词打分来用作零样本或少样本分类器,但它们对对抗性提示仍然很脆弱。先前的工作通常优化任务或模型特定的触发器,这使得结果难以比较并限制了可迁移性。我们研究了通用对抗后缀:短的令牌序列(4-10个令牌),当附加到任何输入时,能广泛降低跨任务和模型的准确性。我们的方法使用Gumbel-Softmax松弛以可微的“软”形式学习后缀,然后将其离散化用于推理。训练在标签区域上最大化校准的交叉熵,同时掩蔽金标令牌以防止琐碎的泄漏,并使用熵正则化避免崩溃。在一个模型上训练的单个后缀能有效迁移到其他模型,持续降低准确性和校准置信度。在Qwen2-1.5B、Phi-1.5和TinyLlama-1.1B上的情感分析、自然语言推理、释义检测、常识问答和物理推理实验证明了跨任务和模型家族的一致攻击有效性和迁移性。

关键词

引用

@article{arxiv.2512.08123,
  title  = {Universal Adversarial Suffixes Using Calibrated Gumbel-Softmax Relaxation},
  author = {Sampriti Soor and Suklav Ghosh and Arijit Sur},
  journal= {arXiv preprint arXiv:2512.08123},
  year   = {2025}
}

备注

10 pages