BPE 坚守 SCRIPT:用于鲁棒多语言预分词的结构化编码
计算与语言
2025-06-02 v1
摘要
字节对编码(BPE)分词器广泛应用于大语言模型(LLM),但在多语言场景中面临诸多挑战,包括对非西方文字的惩罚以及生成包含不完整 UTF-8 序列的词元。预分词通常依赖复杂的正则表达式,这也可能引入脆弱性和意外的边缘情况。我们提出了 SCRIPT(预分词中的文字类别表示),这是一种新颖的编码方案,通过使用基于 Unicode 文字和类别属性的初始词元来绕过 UTF-8 字节转换。该方法实现了一种尊重文字边界的、简单的基于规则的预分词策略,为基于正则表达式的预分词策略提供了鲁棒的替代方案。我们还引入并验证了一种约束 BPE 合并策略,该策略强制保持字符完整性,适用于 SCRIPT-BPE 和基于字节的 BPE。我们的实验表明,SCRIPT-BPE 在实现具有竞争力的压缩率的同时,消除了对非拉丁文字语言的基于编码的惩罚。
引用
@article{arxiv.2505.24689,
title = {BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization},
author = {Sander Land and Catherine Arnett},
journal= {arXiv preprint arXiv:2505.24689},
year = {2025}
}
备注
9 pages, 2 figures. For associated code, see https://github.com/sanderland/script_bpe