为何人们不使用字符级机器翻译?
计算与语言
2022-04-28 v2
摘要
我们提出一项文献与实证调研,批判性地评估字符级建模在机器翻译(MT)中的现状。尽管文献中有证据表明字符级系统与子词系统相当,但在 WMT 竞赛的竞争性设置中它们几乎从未被使用。我们通过实证表明,即便有了近期字符级自然语言处理的建模创新,字符级 MT 系统仍难以匹敌基于子词的对应系统。字符级 MT 系统既未展现出更好的领域鲁棒性,也未展现出更好的形态泛化能力,尽管其动机常在于此。然而,我们能够展示其对源端噪声的鲁棒性,以及翻译质量不会随解码时 beam size 增大而下降。
引用
@article{arxiv.2110.08191,
title = {Why don't people use character-level machine translation?},
author = {Jindřich Libovický and Helmut Schmid and Alexander Fraser},
journal= {arXiv preprint arXiv:2110.08191},
year = {2022}
}
备注
16 pages, 4 figures; Findings of ACL 2022, camera-ready