中文

利用多种子词提升英-世界语自动文学翻译质量

计算与语言 2020-12-01 v1

摘要

为低资源语言构建机器翻译(MT)系统仍然具有挑战性。对于许多语言对,平行数据并不广泛可用,且在此类情况下 MT 模型无法取得与高资源语言相当的结果。当数据稀缺时,充分利用有限的可用材料至关重要。为此,本文我们提议多次使用相同的平行句,仅每次改变词的切分方式。为此,我们使用多个 Byte Pair Encoding 模型,其配置中采用了不同的合并操作。在我们的实验中,我们使用该技术扩展可用数据并改进涉及低资源语言对即英-世界语的 MT 系统。作为额外贡献,我们发布了一套文学领域的英-世界语平行数据。

关键词

引用

@article{arxiv.2011.14190,
  title  = {Using Multiple Subwords to Improve English-Esperanto Automated Literary Translation Quality},
  author = {Alberto Poncelas and Jan Buts and James Hadley and Andy Way},
  journal= {arXiv preprint arXiv:2011.14190},
  year   = {2020}
}