中文

Speech2Video:用于语音到视频生成的跨模态蒸馏

声音 2021-07-15 v1 计算机视觉与模式识别 音频与语音处理 图像与视频处理

摘要

本文研究仅从语音生成说话人脸视频这一新颖任务。语音到视频生成技术在娱乐、客服及人机交互产业中可催生有趣应用。事实上,语音中的音色、口音与语速可能包含与说话人外貌相关的丰富信息。挑战主要在于从音频信号中解耦出不同的视觉属性。本文提出一种轻量级跨模态蒸馏方法,从未标注视频输入中提取解耦的情感与身份信息。提取的特征随后由生成对抗网络整合为说话人脸视频片段。借助精心设计的判别器,所提框架实现了逼真的生成结果。对已知个体的实验表明,该框架仅从语音中捕捉情感表达,并在视频输出中产生自然面部运动。相较于将语音与说话人静态图像结合的基线方法,所提框架的结果几乎难以区分。用户研究也显示,所提方法在生成视频的情感表达方面优于现有算法。

关键词

引用

@article{arxiv.2107.04806,
  title  = {Speech2Video: Cross-Modal Distillation for Speech to Video Generation},
  author = {Shijing Si and Jianzong Wang and Xiaoyang Qu and Ning Cheng and Wenqi Wei and Xinghua Zhu and Jing Xiao},
  journal= {arXiv preprint arXiv:2107.04806},
  year   = {2021}
}

备注

Accepted by InterSpeech2021