一个 TED 演讲的阿拉伯语-希伯来语平行语料库
计算与语言
2016-10-04 v1 信息检索
摘要
我们描述了一个基于 WIT3 构建的 TED 演讲阿拉伯语-希伯来语平行语料库,WIT3 是一个网络清单,它以更便于机器翻译研究人员使用的方式重新利用了 TED 网站的原始内容。该基准由约 2,000 个演讲组成,其阿拉伯语和希伯来语字幕已被精确对齐并重新排列为句子,每种语言总计约 3.5M 个词元。这些演讲被划分为训练集、开发集和测试集,在所有方面均与 IWSLT 2016 评测活动的机器翻译任务类似。除了描述该基准外,我们还列出了在准备过程中遇到的问题以及为解决这些问题而设计的新方法。提供了基线机器翻译结果和一些句子长度的测量指标,作为对该基准质量的外部评估。
引用
@article{arxiv.1610.00572,
title = {An Arabic-Hebrew parallel corpus of TED talks},
author = {Mauro Cettolo},
journal= {arXiv preprint arXiv:1610.00572},
year = {2016}
}
备注
To appear in Proceedings of the AMTA 2016 Workshop on Semitic Machine Translation (SeMaT)