中文

AnyoneNet:面向任意人物的语音与说话头同步生成

计算机视觉与模式识别 2021-08-29 v2 声音 音频与语音处理

摘要

自动生成合成语音与说话头唇部动作同步的视频,在许多人机交互场景中具有巨大潜力。在本文中,我们提出了一种以文本和任意单张人脸图像作为输入,自动生成同步语音与说话头视频的方法。以往的文本驱动说话头生成方法只能合成特定人的声音,与此不同的是,该方法能够为训练阶段中未出现过的任意人物合成语音。具体而言,该方法将同步语音与说话头视频的生成分解为两个阶段,即文本转语音(TTS)阶段和语音驱动的说话头生成阶段。提出的 TTS 模块是一个以人脸为条件的多人 TTS 模型,它从人脸图像而非语音中获取说话人身份信息,这使我们能够基于输入的人脸图像合成个性化声音。为了从人脸图像生成说话头视频,提出了一种基于面部特征点的方法,该方法能够预测唇部运动和头部旋转。大量实验表明,该方法能够为任意人物和非人物生成同步的语音与说话头视频。合成语音在音色和图像中人物外貌方面表现出与给定人脸的一致性,并且所提出的基于特征点的说话头方法在生成自然说话头视频方面优于 SOTA 的基于特征点的方法。

关键词

引用

@article{arxiv.2108.04325,
  title  = {AnyoneNet: Synchronized Speech and Talking Head Generation for Arbitrary Person},
  author = {Xinsheng Wang and Qicong Xie and Jihua Zhu and Lei Xie and Scharenborg},
  journal= {arXiv preprint arXiv:2108.04325},
  year   = {2021}
}