中文

非典型二元组暴露字节级分词器中不完整词元的漏洞

计算与语言 2025-10-13 v2

摘要

分词是将人类可读文本与模型可读离散词元连接起来的关键步骤。然而,最近的研究表明,分词器可能被利用来引发非预期的模型行为。在这项工作中,我们研究了不完整词元,即由字节级字节对编码(BPE)分词产生的带有孤立字节的不可解码词元。我们假设这类词元严重依赖于其相邻词元,并且在与不熟悉的词元配对时很脆弱。为了证明这一漏洞,我们引入了非典型二元组:旨在利用其依赖性的不完整词元的分布外组合。我们的实验表明,非典型二元组极易产生幻觉行为。令人惊讶的是,当使用替代分词方式时,相同短语的幻觉率显著降低(在 Llama3.1 中降低了 90%)。我们警告字节级 BPE 分词器可能引入的潜在漏洞,这可能会给语言模型带来盲点。

关键词

引用

@article{arxiv.2410.23684,
  title  = {Improbable Bigrams Expose Vulnerabilities of Incomplete Tokens in Byte-Level Tokenizers},
  author = {Eugene Jang and Kimin Lee and Jin-Woo Chung and Keuntae Park and Seungwon Shin},
  journal= {arXiv preprint arXiv:2410.23684},
  year   = {2025}
}

备注

EMNLP 2025 Main