非典型二元组暴露字节级分词器中不完整词元的漏洞
计算与语言
2025-10-13 v2
摘要
分词是将人类可读文本与模型可读离散词元连接起来的关键步骤。然而,最近的研究表明,分词器可能被利用来引发非预期的模型行为。在这项工作中,我们研究了不完整词元,即由字节级字节对编码(BPE)分词产生的带有孤立字节的不可解码词元。我们假设这类词元严重依赖于其相邻词元,并且在与不熟悉的词元配对时很脆弱。为了证明这一漏洞,我们引入了非典型二元组:旨在利用其依赖性的不完整词元的分布外组合。我们的实验表明,非典型二元组极易产生幻觉行为。令人惊讶的是,当使用替代分词方式时,相同短语的幻觉率显著降低(在 Llama3.1 中降低了 90%)。我们警告字节级 BPE 分词器可能引入的潜在漏洞,这可能会给语言模型带来盲点。
引用
@article{arxiv.2410.23684,
title = {Improbable Bigrams Expose Vulnerabilities of Incomplete Tokens in Byte-Level Tokenizers},
author = {Eugene Jang and Kimin Lee and Jin-Woo Chung and Keuntae Park and Seungwon Shin},
journal= {arXiv preprint arXiv:2410.23684},
year = {2025}
}
备注
EMNLP 2025 Main