中文

论语言建模中(近)重复子词的影响

计算与语言 2024-07-18 v3 机器学习

摘要

分词是语言模型的核心部分。它涉及将字符序列分割为子词,并在送入语言模型之前为其分配任意索引。然而,尽管该过程通常是无损的,但它可能导致语言模型训练的样本效率降低:由于它移除了字符级信息,这可能使语言模型更难在相似子词(如 now 和 Now)之间进行泛化。我们将此类子词称为近重复子词。在本文中,我们研究了近重复子词对语言模型训练效率的影响。首先,我们设计了一个实验,给出了如果我们能在近重复子词间完美泛化,模型预期改进的上界。我们通过复制语言模型词汇表中的每个子词来实现这一点,创建了完美等价的子词类。在实验中,我们发现语言模型在完全重复设置下训练时大约需要多 17% 的数据。其次,我们研究了自然产生的近重复子词对语言模型的影响。在这里,我们看到合并它们会显著损害语言模型的性能。因此,尽管子词重复对语言模型训练效率产生负面影响,但自然产生的近重复子词可能并不像预期的那样相似,从而限制了性能提升的潜力。

关键词

引用

@article{arxiv.2404.06508,
  title  = {On the Effect of (Near) Duplicate Subwords in Language Modelling},
  author = {Anton Schäfer and Thomas Hofmann and Imanol Schlag and Tiago Pimentel},
  journal= {arXiv preprint arXiv:2404.06508},
  year   = {2024}
}