音频驱动的情感视频肖像
计算机视觉与模式识别
2021-05-21 v2
摘要
尽管先前在生成音频驱动说话头方面已取得进展,但多数研究聚焦于语音内容与嘴形之间的关联。面部情感作为自然人脸最重要的特征之一,在其方法中常被忽视。本工作中,我们提出情感视频肖像(EVP),一种由音频驱动、合成具有生动情感动态的高品质视频肖像的系统。具体而言,我们提出跨重建情感解耦技术,将语音分解为两个解耦空间,即与时长无关的情感空间与依赖时长的文本内容空间。利用解耦特征,可推导出动态的二维情感面部关键点。随后我们提出目标自适应人脸合成技术,通过弥合推导关键点与目标视频自然头部姿态之间的差距,生成最终的高品质视频肖像。大量实验从定性与定量两方面证明了方法的有效性。
引用
@article{arxiv.2104.07452,
title = {Audio-Driven Emotional Video Portraits},
author = {Xinya Ji and Hang Zhou and Kaisiyuan Wang and Wayne Wu and Chen Change Loy and Xun Cao and Feng Xu},
journal= {arXiv preprint arXiv:2104.07452},
year = {2021}
}
备注
Accepted by CVPR2021