中文

FlowVQTalker:基于归一化流与量化的高质量情感说话人脸生成

计算机视觉与模式识别 2024-04-24 v3

摘要

生成情感说话人脸是一项具有实际应用价值且充满挑战的工作。为了创建逼真的虚拟人,我们从人类视角汲取了两个关键见解:1)音频与非确定性面部动态(包括表情、眨眼、姿态)之间的关联应表现出同步性和一对多映射;2)生动的表情通常伴随着情感感知的高清(HD)纹理与精细的牙齿细节。然而,现有方法往往忽略了这两个方面。为此,本文提出使用归一化流和向量量化建模来同时满足上述两个见解,以生成情感说话人脸。具体而言,我们开发了一个基于流的系数生成器,将面部情感动态编码为一个表示为混合分布的多情感类别潜在空间。生成过程从建模分布中进行随机采样开始,在伴随音频的引导下,同时实现唇形同步和非确定性非语言面部线索的生成。此外,我们设计的向量量化图像生成器将富有表现力的人脸图像创建视为一项码本查询任务,利用学习到的码本提供丰富、高质量的纹理,以增强结果的情感感知。我们进行了大量实验以展示该方法的有效性。

关键词

引用

@article{arxiv.2403.06375,
  title  = {FlowVQTalker: High-Quality Emotional Talking Face Generation through Normalizing Flow and Quantization},
  author = {Shuai Tan and Bin Ji and Ye Pan},
  journal= {arXiv preprint arXiv:2403.06375},
  year   = {2024}
}

备注

11 pages, 11 figures, conference