Style2Talker: 具有情感风格与艺术风格的高分辨率说话人脸生成
计算机视觉与模式识别
2024-03-13 v2
摘要
尽管自动生成音频驱动的说话人脸近期受到越来越多的关注,但以往的工作主要集中于实现与音频的唇形同步,忽略了生成富有表现力的视频的两个关键要素:情感风格与艺术风格。本文提出了一种名为 Style2Talker 的创新性音频驱动说话人脸生成方法。该方法包含两个风格化阶段,即 Style-E 和 Style-A,将文本控制的情感风格与图像控制的艺术风格集成到最终输出中。为了获取与视频对应的稀缺情感文本描述,我们提出了一种无需人工的范式,利用大规模预训练模型自动为现有视听数据集标注情感文本标签。结合合成的情感文本,Style-E 阶段利用大规模 CLIP 模型提取情感表示,将其与音频结合,作为旨在生成 3DMM 模型情感运动系数的高效潜在扩散模型的条件。在 Style-A 阶段,我们开发了系数驱动的运动生成器以及嵌入著名 StyleGAN 中的特定艺术风格路径。这使我们能够利用生成的情感运动系数和艺术风格源图像,合成高分辨率的艺术风格化说话人脸视频。此外,为了更好地保留图像细节并避免伪影,我们将从身份图像中提取的多尺度内容特征输入 StyleGAN,并分别通过设计的内容编码器和细化网络来细化其中间特征图。大量实验结果表明,我们的方法在音频-唇形同步以及情感风格和艺术风格的表现性能方面均优于现有的 SOTA 方法。
引用
@article{arxiv.2403.06365,
title = {Style2Talker: High-Resolution Talking Head Generation with Emotion Style and Art Style},
author = {Shuai Tan and Bin Ji and Ye Pan},
journal= {arXiv preprint arXiv:2403.06365},
year = {2024}
}
备注
9 pages, 5 figures, conference