中文

TalkCLIP:基于文本引导表情说话风格的头像说话生成

计算机视觉与模式识别 2024-08-13 v4

摘要

音频驱动的说话头生成已引起日益增长的关注。为生成具有期望面部表情的说话头视频,先前方法依赖额外参考视频提供表情信息,这类视频可能难以获取从而限制了其使用。本工作中,我们提出TalkCLIP,一个可生成表情由自然语言指定的说话头的框架,从而更便捷地指定表情。为建模从文本到表情的映射,我们首先构建了一个文本-视频配对的说话头数据集,其中每个视频具有描绘粗粒度情绪与细粒度面部运动的多样化文本描述。利用所提数据集,我们引入基于CLIP的风格编码器,将自然语言描述投影到表情表示。TalkCLIP甚至能推断训练期间未见描述的表情。TalkCLIP还可使用文本调节表情强度并编辑表情。大量实验表明,TalkCLIP实现了生成由文本描述引导、具有生动面部表情的照片级真实说话头的前沿能力。

关键词

引用

@article{arxiv.2304.00334,
  title  = {TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles},
  author = {Yifeng Ma and Suzhen Wang and Yu Ding and Bowen Ma and Tangjie Lv and Changjie Fan and Zhipeng Hu and Zhidong Deng and Xin Yu},
  journal= {arXiv preprint arXiv:2304.00334},
  year   = {2024}
}