以法语翻译扩充LibriSpeech:用于直接语音翻译评估的多模态语料库
计算与语言
2018-02-12 v1
摘要
近期口语语言翻译(SLT)的工作试图构建端到端语音到文本翻译,在学习和解码过程中不使用源语言转写。然而,尽管用于训练机器翻译系统的大量平行文本(如Europarl、OpenSubtitles)可得,但目前没有大型(100小时)且开源的平行语料库包含源语言语音与目标语言文本的对齐。本文试图通过扩充一个已有的(单语)语料库:LibriSpeech来填补这一空白。该语料库用于自动语音识别,源自LibriVox项目的朗读有声书,并经过了精细的切分与对齐。在收集与LibriSpeech中英语有声书对应的法语电子书后,我们将语音段在句子层面与其相应翻译对齐,获得了236小时可用平行数据。本文给出了处理细节以及对语料库一小部分进行的人工评估。该评估显示,自动对齐分数与双语对齐质量的人工判断具有合理的相关性。我们相信该语料库(已在线发布)对于可复现的直接语音翻译或更一般的口语语言翻译实验是有用的。
引用
@article{arxiv.1802.03142,
title = {Augmenting Librispeech with French Translations: A Multimodal Corpus for Direct Speech Translation Evaluation},
author = {Ali Can Kocabiyikoglu and Laurent Besacier and Olivier Kraif},
journal= {arXiv preprint arXiv:1802.03142},
year = {2018}
}
备注
LREC 2018, Japan