一个小型 Griko-意大利语语音翻译语料库
计算与语言
2018-07-30 v1
摘要
本文介绍了一个濒危语言 Griko 的极低资源平行语料库的扩展,使其可用于计算研究。该语料库包含 330 个话语(约 20 分钟语音),已转写为意大利语并翻译,带有词级语音到转写以及语音到翻译对齐的标注。语料库还包括形态句法标签和词级注释。应用自动单元发现方法,还生成了伪音素。我们详述了语料库如何被收集、清洗和处理,并通过给出语音到翻译对齐和无监督词发现任务的若干基线结果,说明了其在零资源任务上的使用。该数据集在线可用,旨在促进计算语言记录实验的可复现性与多样性。
引用
@article{arxiv.1807.10740,
title = {A small Griko-Italian speech translation corpus},
author = {Marcely Zanon Boito and Antonios Anastasopoulos and Marika Lekakou and Aline Villavicencio and Laurent Besacier},
journal= {arXiv preprint arXiv:1807.10740},
year = {2018}
}