中文

基于 UTF-16 的 BBPE16:提高多语言语音识别的字节级字节对编码

计算与语言 2026-02-03 v1 人工智能

摘要

多语言自动语音识别(ASR)需要能够高效覆盖多种书写系统的分词方法。基于字节的字节对编码(Byte-level BPE, BBPE)使用 UTF-8 因其语言中性设计和完整 Unicode 支持而广泛采用,但其可变长度编码会导致非罗马字母脚本(如中文、日文、韩文,简称 CJK)的 token 序列膨胀。更长的序列会增加计算负载和内存使用。我们提出 BBPE16,一种基于 UTF-16 的 BBPE 分词器,使大多数现代脚本由统一的 2 字节代码单元表示。BBPE16 保留了 BBPE 的语言中性特性,同时显著改进了跨语言 token 共享。在单语、双语、三语 ASR 以及多语言持续学习设置下,BBPE16 达到或优于原有的准确率;对于中文,可将 token 数量降低最高 10.4%,解码迭代次数降低最高 10.3%。这些降低加快了微调和推理速度,并降低了内存使用,使 BBPE16 成为多语言 ASR 实用的分词选择。

关键词

引用

@article{arxiv.2602.01717,
  title  = {BBPE16: UTF-16-based byte-level byte-pair encoding for improved multilingual speech recognition},
  author = {Hyunsik Kim and Haeri Kim and Munhak Lee and Kyungmin Lee},
  journal= {arXiv preprint arXiv:2602.01717},
  year   = {2026}
}

备注

accepted to ICASSP 2026