Speech2Video:用于语音到视频生成的跨模态蒸馏
声音
2021-07-15 v1 计算机视觉与模式识别
音频与语音处理
图像与视频处理
摘要
本文研究仅从语音生成说话人脸视频这一新颖任务。语音到视频生成技术在娱乐、客服及人机交互产业中可催生有趣应用。事实上,语音中的音色、口音与语速可能包含与说话人外貌相关的丰富信息。挑战主要在于从音频信号中解耦出不同的视觉属性。本文提出一种轻量级跨模态蒸馏方法,从未标注视频输入中提取解耦的情感与身份信息。提取的特征随后由生成对抗网络整合为说话人脸视频片段。借助精心设计的判别器,所提框架实现了逼真的生成结果。对已知个体的实验表明,该框架仅从语音中捕捉情感表达,并在视频输出中产生自然面部运动。相较于将语音与说话人静态图像结合的基线方法,所提框架的结果几乎难以区分。用户研究也显示,所提方法在生成视频的情感表达方面优于现有算法。
引用
@article{arxiv.2107.04806,
title = {Speech2Video: Cross-Modal Distillation for Speech to Video Generation},
author = {Shijing Si and Jianzong Wang and Xiaoyang Qu and Ning Cheng and Wenqi Wei and Xinghua Zhu and Jing Xiao},
journal= {arXiv preprint arXiv:2107.04806},
year = {2021}
}
备注
Accepted by InterSpeech2021