MuST-Cinema:一个语音到字幕语料库
计算与语言
2020-02-26 v1
摘要
通过字幕对视听内容进行多语言本地化的需求日益增长,亟需开发用于人工字幕的自动解决方案。神经机器翻译(NMT)可助力字幕自动化,减轻人工字幕员工作负担并缩短周转时间、降低成本。NMT 需要高质量、大规模、任务专用的训练数据。然而,现有字幕语料库既缺少与源语言音频的对齐,也缺少关于字幕断句的重要信息。这给开发高效的自动字幕方法造成了显著限制,因为字幕的长度与形式直接取决于话语的时长。本工作中,我们提出 MuST-Cinema,一个由 TED 字幕构建的多语言语音翻译语料库。该语料库由(音频, 转录, 翻译)三元组构成。字幕断句通过插入特殊符号得以保留。我们展示了该语料库可用于构建高效将句子分割为字幕的模型,并提出了一种为现有字幕语料库标注字幕断句、符合长度约束的方法。
引用
@article{arxiv.2002.10829,
title = {MuST-Cinema: a Speech-to-Subtitles corpus},
author = {Alina Karakanta and Matteo Negri and Marco Turchi},
journal= {arXiv preprint arXiv:2002.10829},
year = {2020}
}
备注
Accepted at LREC 2020