利用多种子词提升英-世界语自动文学翻译质量
计算与语言
2020-12-01 v1
摘要
为低资源语言构建机器翻译(MT)系统仍然具有挑战性。对于许多语言对,平行数据并不广泛可用,且在此类情况下 MT 模型无法取得与高资源语言相当的结果。当数据稀缺时,充分利用有限的可用材料至关重要。为此,本文我们提议多次使用相同的平行句,仅每次改变词的切分方式。为此,我们使用多个 Byte Pair Encoding 模型,其配置中采用了不同的合并操作。在我们的实验中,我们使用该技术扩展可用数据并改进涉及低资源语言对即英-世界语的 MT 系统。作为额外贡献,我们发布了一套文学领域的英-世界语平行数据。
引用
@article{arxiv.2011.14190,
title = {Using Multiple Subwords to Improve English-Esperanto Automated Literary Translation Quality},
author = {Alberto Poncelas and Jan Buts and James Hadley and Andy Way},
journal= {arXiv preprint arXiv:2011.14190},
year = {2020}
}