中文

利用众包进行网络挖掘的日中平行语料库

计算与语言 2024-05-16 v1

摘要

我们利用众包收集了超过 10,000 个包含平行文档的双语网站 URL 对(平行主页对),并从这些网站中创建了一个包含 460 万句对的日中平行语料库。我们使用了一个包含 16 万词对的日中双语词典进行文档和句子对齐。随后,我们使用 120 万高质量的日中句对,训练了一个基于统计语言模型和词翻译概率的平行语料库过滤器。我们将基于这 460 万句对训练的模型与基于 CCMatrix(1240 万句对,一个来自全球网络挖掘的平行语料库)中的日中句对训练的模型的翻译准确率进行了比较。尽管我们的语料库规模仅为 CCMatrix 的三分之一,我们发现两个模型的准确率相当,这证实了利用众包进行平行数据网络挖掘是可行的。

关键词

引用

@article{arxiv.2405.09017,
  title  = {A Japanese-Chinese Parallel Corpus Using Crowdsourcing for Web Mining},
  author = {Masaaki Nagata and Makoto Morishita and Katsuki Chousa and Norihito Yasuda},
  journal= {arXiv preprint arXiv:2405.09017},
  year   = {2024}
}

备注

Work in progress