子词正则化下的预训练语言模型:BPE Dropout 在低资源 NLP 中的实证研究
计算与语言
2026-05-14 v1 机器学习
摘要
子词正则化方法如 BPE dropout 通常仅应用于微调期间,而预训练通常使用确定性分词。这是一种潜在的分词不匹配。我们研究在低资源 NLP 中应用 BPE dropout 进行预训练是否能提高下游性能。我们在英语、德语、法语、西班牙语、基西瓦希利和伊西乌乌萨的英文、德语、法语、西班牙语、基西瓦希利和伊西乌乌萨的单语和双语 BERT 模型上进行训练,并在 XNLI、PAWS-X、PAN-X 和 MasakhaNER 2.0 上对其进行评估。在各种任务中,通常在预训练和微调期间都应用随机分词可获得最佳结果,而仅在微调期间应用 BPE dropout 可能在小数据集tings 下不如确定性分词表现。随着微调数据的增加,这种劣势逐渐减小,而预训练期间 BPE dropout 的优势在预训练或微调数据稀缺时最大化。在大多数情况下,BPE dropout 的好处归因于更好的组合表示,尤其是针对罕见单词。为了检验这一假设,我们测量 BPE dropout 下形态学边界的对齐情况,发现仅有适度的改进,而更准确的分段仍然罕见。这表明微调本身可能仅提供有限的此类分段暴露,而在预训练期间进行随机分词可更持续地将其暴露给模型。我们进一步展示,在微调期间选择性地引入形态学对齐分段可主要提高未应用 BPE dropout 预训练的模型性能。总体而言,这些发现表明,暴露于更准确的分段可能有助于预训练期间应用 BPE dropout 的下游效益。
关键词
引用
@article{arxiv.2605.13436,
title = {Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP},
author = {Ruan Visser and Trienko Grobler and Marcel Dunaiski},
journal= {arXiv preprint arXiv:2605.13436},
year = {2026}
}
备注
Comments: 12 pages, 8 figures, 5 tables