对抗性分词
计算与语言
2025-06-09 v2 人工智能
机器学习
摘要
当前的 LLM 流水线仅考虑给定字符串的一种可能分词方式,在训练和推理期间忽略了呈指数级增长的众多替代分词方式。例如,penguin 的标准 Llama3 分词是 [p,enguin],但 [peng,uin] 是另一个完全有效的替代方案。在本文中,我们表明尽管 LLM 仅在一种分词方式上受过训练,它们仍保留了对其他分词方式的语义理解,这引发了关于其对 LLM 安全性影响的疑问。简而言之,我们回答了以下问题:我们能否对明显恶意的字符串进行对抗性分词,以规避安全和对齐限制?我们表明,对抗性分词不仅是一个有效但此前被忽视的攻击维度,而且在不改变有害请求文本的情况下,它与现有最先进的对抗方法相比具有竞争力。我们在三个最先进的 LLM 和对抗数据集上实证验证了这种漏洞利用,揭示了子词模型中一个此前未知的漏洞。
引用
@article{arxiv.2503.02174,
title = {Adversarial Tokenization},
author = {Renato Lui Geh and Zilei Shao and Guy Van den Broeck},
journal= {arXiv preprint arXiv:2503.02174},
year = {2025}
}
备注
Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, ACL 2025