中文

Broken-Token: 通过计数字符-标记比率过滤被混淆的提示

密码学与安全 2025-11-03 v1 人工智能 计算与语言 信息论 math.IT

摘要

大语言模型(LLM)易受越狱攻击的威胁,这类攻击使用密码学和字符级编码掩饰恶意提示,以规避安全警戒。尽管这些警戒往往无法解码这些编码内容,但底层模型仍可处理有害指令。我们引入一种新型 CPT-Filtering 方法,这是一种对模型agnostic、几乎无成本且接近完美准确率的警戒技术,旨在通过利用字节对编码(BPE)标记器的内在行为来缓解此类攻击。我们的方法基于以下原则:标记器在自然语言上进行训练,对于超出分布的文本(如密码),会显著使用更多更短的标记。该技术利用语言模型的一个简单而强大的属性:文本中字符数除以标记数的平均值(CPT)。这种方法的灵感来自于现代方法的高计算成本——依赖添加专用 LLM 或困惑度模型。我们在超过 100,000 条提示的大型数据集上对该方法进行了验证,测试了众多编码方案及多个流行标记器。我们的实验表明,一个简单的 CPT 阈值能够以高准确率稳健地识别编码文本,即使输入非常短也同样如此。CPT-Filtering 提供了一个可立即部署用于实时文本过滤和离线数据精选的实用防御层。

关键词

引用

@article{arxiv.2510.26847,
  title  = {Broken-Token: Filtering Obfuscated Prompts by Counting Characters-Per-Token},
  author = {Shaked Zychlinski and Yuval Kainan},
  journal= {arXiv preprint arXiv:2510.26847},
  year   = {2025}
}

备注

16 pages, 9 figures