中文

StyleTalk:具有可控说话风格的一次性说话头生成

计算机视觉与模式识别 2023-06-13 v2

摘要

不同人以多样化的个性化说话风格交谈。尽管现有的一次性说话头方法在唇形同步、自然面部表情和稳定头部运动方面已取得显著进展,但仍无法在最终说话头视频中生成多样化的说话风格。为解决该问题,我们提出了一种一次性风格可控的说话人脸生成框架。简而言之,我们的目标是从任意参考说话视频中获取说话风格,并驱动一次性肖像以该参考说话风格及另一段音频进行说话。具体而言,我们首先开发了一个风格编码器,用于提取风格参考视频的动态面部运动模式,并将其编码为风格码。随后,我们引入一个风格可控解码器,从语音内容与风格码合成风格化面部动画。为将参考说话风格融入生成视频,我们设计了一个风格感知自适应 transformer,使编码后的风格码能相应调整前馈层的权重。得益于风格感知自适应机制,参考说话风格在解码过程中能更好地嵌入合成视频。大量实验表明,我们的方法仅用一张肖像图像和一段音频片段即可生成具有多样说话风格的说话头视频,同时实现逼真的视觉效果。项目主页:https://github.com/FuxiVirtualHuman/styletalk。

关键词

引用

@article{arxiv.2301.01081,
  title  = {StyleTalk: One-shot Talking Head Generation with Controllable Speaking Styles},
  author = {Yifeng Ma and Suzhen Wang and Zhipeng Hu and Changjie Fan and Tangjie Lv and Yu Ding and Zhidong Deng and Xin Yu},
  journal= {arXiv preprint arXiv:2301.01081},
  year   = {2023}
}

备注

Accepted at AAAI2023 as Oral. Demo: https://youtu.be/mO2Tjcwr4u8