中文

带有文档结构标注的软件文档并行评估数据集

计算与语言 2020-11-13 v2

摘要

本文 accompanies 我们向机器翻译社区发布的用于机器翻译的软件文档数据集,该数据集为源自 SAP 帮助门户的并行评估数据,供研究使用。它提供了在企业软件文档领域调优和评估机器翻译系统的可能,并有助于提供更广泛的评估场景。该数据集包含英语到印地语、印尼语、马来语和泰语的语言对,从而也提升了对众多低资源语言对的测试覆盖率。与多数由纯平行文本组成的评估数据集不同,该数据集中的句段附带描述文档上下文结构信息的额外元数据。我们提供了关于该数据集的来源与构建、特性与特征以及机器翻译结果的深入说明。

关键词

引用

@article{arxiv.2008.04550,
  title  = {A Parallel Evaluation Data Set of Software Documentation with Document Structure Annotation},
  author = {Bianka Buschbeck and Miriam Exel},
  journal= {arXiv preprint arXiv:2008.04550},
  year   = {2020}
}

备注

Accepted for publication at WAT 2020; update to camera-ready version