中文

面向双语翻译等价物的无监督可比语料准备与探索

计算与语言 2015-12-08 v1 机器学习

摘要

世界的多语特性使得翻译成为当今的关键需求。由人类构建的平行词典是广泛可用的资源,但由于未登录词和新词,它们有限且不能为高质量翻译目的提供足够的覆盖率。这促使了统计翻译系统的使用,遗憾的是这些系统依赖于训练数据的数量和质量。此类系统的可用性非常有限,尤其对于某些语言和极窄的文本领域。在本研究中,我们通过重新实现比较算法(使用 Needleman-Wunch 算法)、引入调优脚本以及通过 GPU 加速改进计算时间,展示了对当前可比语料挖掘方法的改进。实验在从维基百科提取的各种领域的双语数据上进行。对于维基百科本身,引入了额外的跨语言比较启发式方法。这些修改对挖掘数据的质量和数量以及翻译质量产生了积极影响。

关键词

引用

@article{arxiv.1512.01641,
  title  = {Unsupervised comparable corpora preparation and exploration for bi-lingual translation equivalents},
  author = {Krzysztof Wołk and Krzysztof Marasek},
  journal= {arXiv preprint arXiv:1512.01641},
  year   = {2015}
}

备注

arXiv admin note: text overlap with arXiv:1509.08639