一刀切并不适用:为跨语言 fastText 模型寻找最优子词大小
计算与语言
2021-09-21 v3
摘要
从大型多语言语料库中对词进行无监督表示学习,对词义消歧、语义文本相似度和信息检索等下游任务颇有助益。对数双线性 fastText 模型的表示精度主要归功于其对子词信息的利用。在既往工作中,fastText 子词大小的优化未得到充分探索,非英语 fastText 模型训练时使用了针对英语与德语词类比任务优化的子词大小。在我们的工作中,我们在英语、德语、捷克语、意大利语、西班牙语、法语、印地语、土耳其语和俄语的词类比任务上找到了最优子词大小。随后我们提出一个简单的 n-gram 覆盖模型,并表明该模型在西班牙语、法语、印地语、土耳其语和俄语词类比任务上能预测出优于默认值的子词大小。我们表明 fastText 子词大小的优化至关重要,并在捷克语词类比任务上带来 14% 的提升。我们还表明,昂贵的参数优化可被简单的 n-gram 覆盖模型替代,该模型相较默认子词大小在词类比任务上持续提升 fastText 模型精度达 3%,且与最优子词大小的精度差距在 1% 以内。
引用
@article{arxiv.2102.02585,
title = {One Size Does Not Fit All: Finding the Optimal Subword Sizes for FastText Models across Languages},
author = {Vít Novotný and Eniafe Festus Ayetiran and Dalibor Bačovský and Dávid Lupták and Michal Štefánik and Petr Sojka},
journal= {arXiv preprint arXiv:2102.02585},
year = {2021}
}