CMP-RT:用于红队测试的码混音素perturbations
计算与语言
2026-04-08 v5 人工智能
摘要
安全对齐的大语言模型(LLM)仍然容易受到数字现象的攻击,如 textese,这类现象会引入对单词造成非规范扰动但保留语音的文本。我们引入 CMP-RT(code-mixed phonetic perturbations for red-teaming,即码混音素perturbations for红队测试),这是一种新型诊断探针,用于定位分词作为此类漏洞根源的机制。机制分析揭示,语音扰动会将安全关键 token 碎片化为良好无害的子词,抑制其归因分数但保留提示可解释性——导致安全机制在保持优异输入理解能力的同时失效。我们演示了这一漏洞可被规避,跨模态且持续存在于包括 Gemini-3-Pro 在内的前沿模型中,并且通过简单的监督微调(SFT)可放大。此外,层级探针显示扰动输入和规范输入的表示在关键层深度处对齐;强制输出等效可稳健恢复丢失的表示,为训练与对齐之间结构性差距提供因果证据,并确立分词作为当前安全管道中关键且未被充分检视的漏洞。
引用
@article{arxiv.2505.14226,
title = {Phonetic Perturbations Reveal Tokenizer-Rooted Safety Gaps in LLMs},
author = {Darpan Aswal and Siddharth D Jaiswal},
journal= {arXiv preprint arXiv:2505.14226},
year = {2026}
}