中文

从译制剧集构建语音到语音语料库

计算与语言 2022-03-08 v1

摘要

近年来,在主要媒体服务商的大力支持下,译制剧集越来越受欢迎。诸如研究表明电视剧的译制版本比其字幕版本更受欢迎,进一步推动了这种流行。我们提出一种无监督方法来构建短片段级对齐的语音到语音语料库,以生成源语言与目标语言的并行语音语料库。我们的方法利用视频帧、语音识别、机器翻译以及噪声帧去除算法来匹配两种语言中的片段。为验证所提方法的性能,我们将其应用于长、短译制片段。在36小时的土耳其语-阿拉伯语(TR-AR)译制剧集中,我们的流水线能够生成17小时的配对片段,约占语料库的47%。我们将方法应用于另一语言对英语-阿拉伯语(EN-AR),以确保其足够鲁棒而非针对特定语言或特定语料库调参。无论语言对如何,经人工主观评价,配对片段的准确率约为70%。该语料库将免费提供给研究界。

关键词

引用

@article{arxiv.2203.03601,
  title  = {Creating Speech-to-Speech Corpus from Dubbed Series},
  author = {Massa Baali and Wassim El-Hajj and Ahmed Ali},
  journal= {arXiv preprint arXiv:2203.03601},
  year   = {2022}
}