V2C:视觉语音克隆
计算机视觉与模式识别
2021-11-29 v1 声音
音频与语音处理
摘要
现有的语音克隆 (VC) 任务旨在将一段段落文本转换为由参考音频指定所需语音的语音。这极大地促进了人工语音应用的发展。然而,还有许多场景无法通过这些 VC 任务得到很好的反映,例如电影配音,它要求语音具有与电影情节一致的情感。为了填补这一空白,在本文中我们提出了一项名为视觉语音克隆 (V2C) 的新任务,旨在将一段段落文本转换为既具有由参考音频指定所需语音、又具有由参考视频指定所需情感的语音。为了促进该领域的研究,我们构建了一个数据集 V2C-Animation,并基于现有的 SOTA VC 技术提出了一个强大的基线。我们的数据集包含 10,217 个动画电影片段,涵盖了多种类型(例如喜剧、奇幻)和情感(例如高兴、悲伤)。我们进一步设计了一套名为 MCD-DTW-SL 的评估指标,以帮助评估真实语音与合成语音之间的相似度。大量实验结果表明,即使是 SOTA VC 方法也无法为我们的 V2C 任务生成令人满意的语音。我们希望所提出的新任务连同构建的数据集和评估指标将促进语音克隆领域以及更广泛的视觉与语言社区的研究。
引用
@article{arxiv.2111.12890,
title = {V2C: Visual Voice Cloning},
author = {Qi Chen and Yuanqing Li and Yuankai Qi and Jiaqiu Zhou and Mingkui Tan and Qi Wu},
journal= {arXiv preprint arXiv:2111.12890},
year = {2021}
}
备注
15 pages, 14 figures