中文

VLOGGER:用于具身虚拟形象合成的多模态扩散模型

计算机视觉与模式识别 2024-03-14 v1

摘要

我们提出了 VLOGGER,一种从单张人物输入图像生成音频驱动人物视频的方法,该方法建立在近期生成式扩散模型成功的基础之上。我们的方法包括:1) 一个随机的人体到 3D 运动扩散模型,以及 2) 一种新颖的基于扩散的架构,该架构通过空间和时间控制增强了文本到图像模型。这支持生成可变长度的高质量视频,且易于通过人脸和人体的高级表征进行控制。与以往工作不同,我们的方法不需要对每个人进行训练,不依赖人脸检测和裁剪,生成完整图像(不仅是人脸或嘴唇),并考虑了广泛的场景(例如可见的躯干或多样的主体身份),这对于正确合成正在交流的人类至关重要。我们还策划了 MENTOR,一个具有 3D 姿态和表情标注的全新多样化数据集,其规模比以往数据集大一个数量级(800,000 个身份)并包含动态手势,我们在此基础上训练并消融了我们的主要技术贡献。VLOGGER 在三个公共基准测试中超越了 SOTA 方法,在考虑图像质量、身份保持和时间一致性的同时还能生成上半身手势。我们分析了 VLOGGER 在多种多样性指标下的性能,表明我们的架构选择和 MENTOR 的使用有利于大规模训练公平无偏的模型。最后,我们展示了在视频编辑和个性化方面的应用。

关键词

引用

@article{arxiv.2403.08764,
  title  = {VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis},
  author = {Enric Corona and Andrei Zanfir and Eduard Gabriel Bazavan and Nikos Kolotouros and Thiemo Alldieck and Cristian Sminchisescu},
  journal= {arXiv preprint arXiv:2403.08764},
  year   = {2024}
}

备注

Project web: https://enriccorona.github.io/vlogger/