中文

以任意风格述说任意内容

计算机视觉与模式识别 2024-03-14 v2

摘要

生成具有多样头部运动的风格化说话人脸对于实现自然逼真的视频至关重要,但仍然具有挑战性。以往工作要么采用回归方法捕捉说话风格,导致在所有训练数据上被平均化的粗糙风格;要么采用通用网络合成不同风格的视频,导致次优性能。为解决这些问题,我们提出了一种新颖的动态权重方法,即以任意风格述说任意内容,该方法通过带有学习风格码本的生成模型查询离散风格表征。具体而言,我们开发了一个多任务 VQ-VAE,整合了三个密切相关任务,以学习风格码本作为风格提取的先验。这种离散先验与生成模型相结合,在提取给定风格片段的说话风格时增强了精度和鲁棒性。通过利用提取的风格,采用由标准分支和特定风格分支组成的残差架构,在以任意驱动音频为条件预测嘴形的同时,将说话风格从源风格迁移至任意目标风格。为适应不同的说话风格,我们避免使用通用网络,而是探索了一种精巧的 HyperStyle 来为风格分支生成特定风格的权重偏移。此外,我们构建了姿态生成器和姿态码本来存储量化姿态表征,使我们能够采样与音频和提取风格对齐的多样头部运动。实验表明,我们的方法在唇形同步和风格化表情方面均超越了 SOTA 方法。此外,我们将 SAAS 扩展至视频驱动的风格编辑领域,并取得了令人满意的性能。

关键词

引用

@article{arxiv.2403.06363,
  title  = {Say Anything with Any Style},
  author = {Shuai Tan and Bin Ji and Yu Ding and Ye Pan},
  journal= {arXiv preprint arXiv:2403.06363},
  year   = {2024}
}

备注

9 pages, 5 figures, conference