中文

面向遮掩攻击的 Transformer 防御几何极限:潜在嵌入坍缩与性能鲁棒性差距

密码学与安全 2026-05-20 v1

摘要

提示注入攻击对语言模型的安全性构成重大风险,但现有的防御措施通常仅基于分类性能进行评估。我们指出,高检测性能并不意味着表征鲁棒性。具体而言,组合同音字、零宽字符以及标点或表情符号噪声的多操作遮掩提示(multi-operator obfuscated prompts)会部分坍缩到干净提示的嵌入流形上,我们称之为潜在嵌入坍缩(latent embedding collapse)。结果表明,在多个具有不同深度和容量的 BERT 系列编码器中,检测器实现近乎完美的分类性能,但最小干净-遮掩间隔 delta = 1.02,表明遮掩和干净嵌入几乎重叠。遮掩嵌入进一步显示出 elevated 的类内方差 (3.33 +/- 6.23),表明尽管分类性能高,但潜在空间存在严重的不稳定性。这些结果揭示了巨大的性能-鲁棒性差距,表明标准的评估指标未能捕捉潜在嵌入坍缩及其几何脆弱性。我们的发现表明,增加模型容量并不能消除潜在嵌入坍缩,这激励将几何感知鲁棒性分析作为基于性能的评估之所必需的补充手段,用于提示注入防御。

关键词

引用

@article{arxiv.2605.19159,
  title  = {On the Geometric Limits of Transformer Defenses against Obfuscation Attacks: Latent Embedding Collapse & Performance Robustness Gap},
  author = {Becky Mashaido and Tapadhir Das},
  journal= {arXiv preprint arXiv:2605.19159},
  year   = {2026}
}