训练即忘卜:BPE 推断无需合并列表
计算与语言
2025-08-12 v1
摘要
标准的字节配对编码 (BPE) 分词通过将学习到的词汇表与详细的合并列表配对来压缩文本。最近的研究表明,这一合并列表可能暴露出从语言模型训练数据中提取信息的潜在攻击面。在本文中,我们探讨了不依赖该合并列表的 BPE 推断算法的下游影响,即与 BPE 训练期间的编码过程不同。为回答此问题,我们检验两大类与 BPE 训练期间的应用不同的推断方案:a) 对合并列表的有针对性偏离,包括随机合并顺序以及各种合并列表的损坏(涉及删除/截断),和 b) 不依赖合并列表的非针对性 BPE 推断算法,侧重于以贪心或精确方式压缩文本。广泛的实验覆盖 diverse language modeling 任务,如基于准确性的 QA 基准、机器翻译和开放式生成,结果显示,针对性偏离合并列表会对语言模型性能造成显著下降,而非针对性、无合并列表的推断算法对下游性能影响最小,往往远小于人们的预期。这些发现为更简单且潜在更具隐私保护性的分词方案铺平了道路,这些方案不会在性能上造成灾难性损失。
引用
@article{arxiv.2508.06621,
title = {Train It and Forget It: Merge Lists are Unnecessary for BPE Inference in Language Models},
author = {Tomohiro Sawada and Kartik Goyal},
journal= {arXiv preprint arXiv:2508.06621},
year = {2025}
}
备注
Submitted to EMNLP