中文

VAST:通过零样本富有表现力的面部风格迁移激活你的说话头像

计算机视觉与模式识别 2024-11-21 v3

摘要

当前的说话人脸生成方法主要关注语音-嘴唇同步。然而,对面部说话风格的探究不足导致头像呆板且单调。大多数先前工作未能从任意视频提示中模仿富有表现力的风格,并确保生成视频的真实性。本文提出一种无监督变分风格迁移模型(VAST)来激活中性照片级真实头像。我们的模型由三个关键组件构成:从给定视频提示中提取面部风格表示的风格编码器;建模准确语音相关运动的混合面部表情解码器;增强风格空间以极具表现力且富有意义的变分风格增强器。凭借我们在面部风格学习上的核心设计,我们的模型能够灵活地从任意视频提示中捕获富有表现力的面部风格,并以零样本方式将其迁移到个性化图像渲染器上。实验结果表明,所提方法有助于生成具有更高真实性与更丰富表现力的更生动说话头像。

关键词

引用

@article{arxiv.2308.04830,
  title  = {VAST: Vivify Your Talking Avatar via Zero-Shot Expressive Facial Style Transfer},
  author = {Liyang Chen and Zhiyong Wu and Runnan Li and Weihong Bao and Jun Ling and Xu Tan and Sheng Zhao},
  journal= {arXiv preprint arXiv:2308.04830},
  year   = {2024}
}

备注

Accepted by ICCV2023