中文

面向开源语言模型的特殊字符对抗攻击

密码学与安全 2025-11-27 v2 人工智能

摘要

大语言模型 (LLM) 在 diverse 自然语言处理任务上取得了显著性能,但其对字符级别对抗操纵的脆弱性为实际部署带来了显著安全挑战。本文研究了包括 unicode、同形字、结构和文本编码攻击等不同特殊字符攻击,以突破安全机制。我们在 4000 多次攻击尝试中评估了 7 个主流开源模型(参数规模从 38 亿到 320 亿)。这些实验揭示了所有模型规模都存在关键脆弱性,暴露了包括成功越狱、无意义输出和无关幻觉等 failure 模式。

关键词

引用

@article{arxiv.2508.14070,
  title  = {Special-Character Adversarial Attacks on Open-Source Language Model},
  author = {Ephraiem Sarabamoun},
  journal= {arXiv preprint arXiv:2508.14070},
  year   = {2025}
}