中文

从 Common Crawl 中提取平行段落

计算与语言 2018-04-30 v1

摘要

当前大多数从网页中挖掘平行文本的方法都假设同一网站的不同语言网页具有相同的结构。我们认为仍存在不可忽视数量的平行数据分散在不满足此假设的来源中。我们提出一种基于 bivec(word2vec 的双语扩展)与局部敏感哈希相结合的方法,该方法使我们能够高效识别给定网络域内页面上任意位置的平行段落对,而不受其结构影响。我们在大规模平行语料的重对齐任务上验证了该方法。另一项由 Common Crawl Foundation 提供的真实数据实验证实,我们的方案可扩展至数百 TB 规模的网页抓取数据。

关键词

引用

@article{arxiv.1804.10413,
  title  = {Extracting Parallel Paragraphs from Common Crawl},
  author = {Jakub Kúdela and Irena Holubová and Ondřej Bojar},
  journal= {arXiv preprint arXiv:1804.10413},
  year   = {2018}
}

备注

Accepted to the Prague Bulletin of Mathematical Linguistics 107, April 2017