中文

VideoDubber:面向视频配音的具有语音感知长度控制的机器翻译

计算与语言 2023-12-06 v2 人工智能 机器学习 多媒体 音频与语音处理

摘要

视频配音旨在将影视节目中的原始语音翻译为目标语言的语音,可通过由语音识别、机器翻译和语音合成组成的级联系统实现。为确保翻译后的语音与相应视频良好对齐,翻译语音的长度/时长应尽可能接近原始语音,这需要严格的长度控制。以往工作通常控制机器翻译模型生成的词或字符数量与源句相似,而未考虑语音的等时性,因为不同语言中词/字符的语音时长各异。本文提出一种专为视频配音任务定制的机器翻译系统,其直接考虑翻译中每个词元的语音时长,以匹配源语音与目标语音的长度。具体而言,我们通过用时长信息(包括自身的语音时长以及剩余词元尚余多少时长)引导每个词的预测,来控制生成句子的语音长度。我们在四个语言方向(德语→英语、西班牙语→英语、中文↔英语)上设计实验,结果表明所提方法在生成语音的长度控制能力上优于基线方法。为弥补真实世界数据集的不足,我们还构建了一个从电影中收集的真实世界测试集,以对视频配音任务提供全面评估。

关键词

引用

@article{arxiv.2211.16934,
  title  = {VideoDubber: Machine Translation with Speech-Aware Length Control for Video Dubbing},
  author = {Yihan Wu and Junliang Guo and Xu Tan and Chen Zhang and Bohan Li and Ruihua Song and Lei He and Sheng Zhao and Arul Menezes and Jiang Bian},
  journal= {arXiv preprint arXiv:2211.16934},
  year   = {2023}
}

备注

AAAI 2023 camera version