中文

学位论文摘要平行语料库

计算与语言 2019-05-07 v1

摘要

在巴西,负责监督与协调研究生项目的政府机构 CAPES 保存了该国所有学位论文的记录。此类文档的信息可在学位论文目录(TDC)中在线访问,其包含葡萄牙语与英语摘要以及附加元数据。因此,该数据库可成为葡萄牙语与英语平行语料的潜在来源。本文中,我们展示了基于 CAPES 在开放数据倡议下提供的 TDC 构建平行语料库的过程。我们收集了约 240,000 篇文档并使用 Hunalign 工具进行对齐。我们通过训练统计机器翻译(SMT)与神经机器翻译(NMT)模型(双向)并与谷歌翻译(GT)比较,展示了所建语料库的能力。两种翻译模型均取得优于 GT 的 BLEU 分数,其中 NMT 系统最为准确。句子对齐也经人工评估,正确对齐句子平均占比 82.30%。我们的平行语料库以 TMX 格式免费提供,并附文档元数据补充信息。

关键词

引用

@article{arxiv.1905.01715,
  title  = {A Parallel Corpus of Theses and Dissertations Abstracts},
  author = {Felipe Soares and Gabrielli Harumi Yamashita and Michel Jose Anzanello},
  journal= {arXiv preprint arXiv:1905.01715},
  year   = {2019}
}

备注

Published in the PROPOR Conference. arXiv admin note: text overlap with arXiv:1905.01712