MetaBreak:通过特殊令牌操纵越狱在线LLM服务
密码学与安全
2025-10-14 v1 人工智能
摘要
与源自现有文本语料库的常规令牌不同,特殊令牌是人为创建的,用于在大型语言模型(LLM)的微调过程中注释结构化对话。作为训练数据的元数据,这些令牌在指导LLM生成连贯且上下文感知的响应中起着关键作用。我们证明,特殊令牌可以被利用来构建四种攻击原语,恶意用户可以利用这些原语可靠地绕过在线LLM服务的内部安全对齐,同时规避最先进(SOTA)的外部内容审核系统。此外,我们发现应对这一威胁具有挑战性,因为激进的防御机制——例如学术界建议的通过完全移除特殊令牌进行输入清理——效果不如预期。这是因为当特殊令牌被令牌化器嵌入空间中具有高语义相似性的常规令牌替换时,此类防御可以被规避。我们在实验室环境和商业LLM平台上系统评估了我们名为MetaBreak的方法。在没有部署内容审核的情况下,我们的方法实现了与基于SOTA提示工程的解决方案相当的越狱率。然而,当存在内容审核时,MetaBreak分别比SOTA解决方案PAP和GPTFuzzer高出11.6%和34.8%。最后,由于MetaBreak采用了与提示工程根本不同的策略,这两种方法可以协同工作。值得注意的是,将MetaBreak赋能于PAP和GPTFuzzer,分别将越狱率提高了24.3%和20.2%。
引用
@article{arxiv.2510.10271,
title = {MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation},
author = {Wentian Zhu and Zhen Xiang and Wei Niu and Le Guan},
journal= {arXiv preprint arXiv:2510.10271},
year = {2025}
}