寻找神经机器翻译的最优词表大小
计算与语言
2021-04-06 v2 机器学习
机器学习
摘要
我们将神经机器翻译(NMT)视为自回归设定下的分类任务,并分析分类与自回归两个组件的局限。已知分类器在训练期间类别分布均衡时表现更好。由于语言的齐夫(Zipfian)特性导致类别不平衡,我们探究其对NMT的影响。我们分析了多种词表大小对多语言、多数据规模下NMT性能的影响,并揭示了一些词表大小优于其他词表大小的原因。
引用
@article{arxiv.2004.02334,
title = {Finding the Optimal Vocabulary Size for Neural Machine Translation},
author = {Thamme Gowda and Jonathan May},
journal= {arXiv preprint arXiv:2004.02334},
year = {2021}
}