中文

低资源口语方言的机器翻译:瑞士德语规范化策略

计算与语言 2018-02-07 v2

摘要

本工作的目标是为一组统称为瑞士德语的低资源方言家族设计机器翻译(MT)系统,这些方言在瑞士被广泛使用但很少被书写。我们首先收集了数量可观的平行书面资源,总计约 6 万词。此外,我们确定了若干其他有前景的瑞士德语数据来源。随后,我们设计并比较了三种用于规范化瑞士德语输入的策略,以应对地区多样性。我们发现基于字符的神经 MT 是文本规范化的最佳方案。结合基于短语的统计 MT,我们的方案在从伯尔尼方言翻译时达到了 36% 的 BLEU 分数。然而,当测试数据在地理和主题上偏离训练数据时,该数值会下降。这些资源与规范化技术是实现瑞士德语方言完整 MT 的第一步。

关键词

引用

@article{arxiv.1710.11035,
  title  = {Machine Translation of Low-Resource Spoken Dialects: Strategies for Normalizing Swiss German},
  author = {Pierre-Edouard Honnet and Andrei Popescu-Belis and Claudiu Musat and Michael Baeriswyl},
  journal= {arXiv preprint arXiv:1710.11035},
  year   = {2018}
}

备注

11th Language Resources and Evaluation Conference (LREC), 7-12 May 2018, Miyazaki (Japan)