StyleTalk++:面向说话风格的统一说话人头像控制框架
计算机视觉与模式识别
2024-09-17 v1
摘要
个体拥有独特的面部表情和头部姿态风格,这些风格反映了他们的个人说话风格。现有的单次说话头像方法无法捕获此类个人特征,因而无法在最终视频中生成多样化的说话风格。为解决这一挑战,我们提出了一种单次可控制说话风格的说话人脸生成方法,该方法可从参考说话视频中获取说话风格,并驱动单次肖像以参考说话风格和另一段音频进行说话。我们的方法旨在统一框架中合成 3D 形状可调模型(3DMM)的可控系数,包括面部表情和头部运动。具体而言,提出的框架首先利用风格编码器从参考视频中提取所需的说话风格并将其转换为风格代码。随后,框架使用风格感知解码器从音频输入和风格代码中合成 3DMM 的系数。在解码过程中,该框架采用双分支架构,分别生成风格化的面部表情系数和风格化的头部运动系数。获得 3DMM 的系数后,图像渲染器将表情系数渲染为特定人的说话头像视频。大量实验表明,我们的方法仅需一个肖像图像和一个音频片段即可生成具有多样化说话风格的视觉逼真的说话人头像视频。
引用
@article{arxiv.2409.09292,
title = {StyleTalk++: A Unified Framework for Controlling the Speaking Styles of Talking Heads},
author = {Suzhen Wang and Yifeng Ma and Yu Ding and Zhipeng Hu and Changjie Fan and Tangjie Lv and Zhidong Deng and Xin Yu},
journal= {arXiv preprint arXiv:2409.09292},
year = {2024}
}
备注
TPAMI 2024. arXiv admin note: text overlap with arXiv:2301.01081