带有文档结构标注的软件文档并行评估数据集
计算与语言
2020-11-13 v2
摘要
本文 accompanies 我们向机器翻译社区发布的用于机器翻译的软件文档数据集,该数据集为源自 SAP 帮助门户的并行评估数据,供研究使用。它提供了在企业软件文档领域调优和评估机器翻译系统的可能,并有助于提供更广泛的评估场景。该数据集包含英语到印地语、印尼语、马来语和泰语的语言对,从而也提升了对众多低资源语言对的测试覆盖率。与多数由纯平行文本组成的评估数据集不同,该数据集中的句段附带描述文档上下文结构信息的额外元数据。我们提供了关于该数据集的来源与构建、特性与特征以及机器翻译结果的深入说明。
引用
@article{arxiv.2008.04550,
title = {A Parallel Evaluation Data Set of Software Documentation with Document Structure Annotation},
author = {Bianka Buschbeck and Miriam Exel},
journal= {arXiv preprint arXiv:2008.04550},
year = {2020}
}
备注
Accepted for publication at WAT 2020; update to camera-ready version