超越默认值:用于最佳机器翻译的非对称字节双编码
计算与语言
2026-02-16 v2
摘要
现有的机器翻译(MT)研究通常建议为词语分段模型(如对称字节双编码,BPE)选择单一、固定的超参数集合,对 source 和 target 语言的 tokenizer 应用相同的合并操作次数(NMO)。然而,我们发现这种统一方法不一定在不同语言对和数据规模下保证最佳的 MT 性能。本文探究了不同数据量和语言对下的 BPE 分段配方,以评估 MT 系统的性能。我们发现,使用非对称 BPE(即 source 和 target 语言具有不同的 NMO)在不同语言对上的结果显著优于对称方法,尤其是在低资源设置(50K、100K 和 500K 句对)中。具体而言,非对称 BPE 在 English-Hindi 低资源环境中(50K、100K 和 500K 句对)分别实现了 5.32、4.46 和 0.7 的 CHRF++ 平均提升(统计显著,)。我们在另外六个语言对(English 和 Telugu、Shona、Norwegian、Kyrgyz、Hausa 和 Inuktitut)上进行了验证,在 12 个系统中有 10 个相对于对称 BPE 实现了统计显著的改进。我们的发现表明,source 采用高 NMO(4K 到 32K)而 target 采用低 NMO(0.5K 到 2K)可获得最佳结果,尤其受益于低资源 MT 场景。
引用
@article{arxiv.2511.03383,
title = {Segmentation Beyond Defaults: Asymmetrical Byte Pair Encoding for Optimal Machine Translation Performance},
author = {Saumitra Yadav and Manish Shrivastava},
journal= {arXiv preprint arXiv:2511.03383},
year = {2026}
}
备注
Accepted at WAT 2025 (Camera-Ready Version)