中文

基于可比语料库的调优与 GPU 加速并行数据挖掘

计算与语言 2015-09-30 v1 人工智能 数据结构与算法

摘要

世界的多语言特性使得翻译成为当今的关键需求。人工构建的平行词典是一种广泛可用的资源,但由于存在未登录词和新词,它们存在局限且无法为高质量翻译提供足够的覆盖。这促使了统计翻译系统的使用,但不幸的是,这些系统依赖于训练数据的数量和质量。此类数据对于某些语言和非常狭窄的文本领域尤其有限。在本研究中,我们展示了对 Yalign 挖掘方法的改进,包括重新实现比对算法、引入调优脚本以及通过 GPU 计算加速提升性能。实验在多种文本领域上进行,并从维基百科转储中提取了双语数据。

关键词

引用

@article{arxiv.1509.08639,
  title  = {Tuned and GPU-accelerated parallel data mining from comparable corpora},
  author = {Krzysztof Wołk and Krzysztof Marasek},
  journal= {arXiv preprint arXiv:1509.08639},
  year   = {2015}
}

备注

Machine translation, comparable corpora, Machine learning, NLP, Knowledge-free learning, Unsupervised bi-lingual data mining