中文

DeepSeek 面向语义-字符双空间变形提示注入的鲁棒性

密码学与安全 2026-04-15 v1

摘要

提示注入已成为大型语言模型(LLM)的关键安全威胁,但现有研究主要关注单维攻击策略,如语义重写或字符级混淆,未能捕捉现实场景中多空间扰动的综合效应。此外,对近期中文大型语言模型如 DeepSeek 的系统性黑箱鲁棒性评估仍有限。为弥补此缺口,我们提出了 PromptFuzz-SC,用于评估 LLM 对提示注入鲁棒性的语义-字符双空间变形框架。该框架集成语义转换(如改写和词序扰动)与字符级混淆(如零宽插入和编码变形),形成统一且可扩展的变形算子库。采用融合 epsilon-greedy 探索与爬坡细化的混合搜索策略,以有效发现高质量对抗提示。我们进一步引入基于三个指标的统一评估协议:误用成功率(MSR)、平均查询次数(ASQ)和隐蔽性。实验结果表明,双空间变形在所评估策略中实现了最强整体攻击性能,达到最高平均 MSR(0.189)、峰值 MSR(0.375)和最高隐蔽性。与语义单一变形和字符单一变形相比,分别提升了平均 MSR 的 12.5% 和 5.6%。虽然查询成本未能始终最小化,但该方法实现了具竞争力的最佳情况效率,并保持强大的隐蔽性,表明在攻击效果与隐蔽性之间取得了更佳的平衡。这些发现凸显了复合变形策略在 LLM 鲁棒性红队测试中的重要性,并为设计多层防御机制提供了实用见解。

关键词

引用

@article{arxiv.2604.12548,
  title  = {DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection},
  author = {Junyu Ren and Xingjian Pan and Wensheng Gan and Philip S. Yu},
  journal= {arXiv preprint arXiv:2604.12548},
  year   = {2026}
}

备注

Preprint