基于大规模扩散判别器的单步扩散图像超分辨率
计算机视觉与模式识别
2024-10-08 v1
摘要
我们提出TANGO框架,用于生成共言语身体手势视频。给定几分钟的单说话者参考视频和目标语音音频,TANGO生成同步手势的高保真视频。TANGO基于Gesture Video Reenactment(GVR),使用有向图结构划分和检索视频片段——将视频帧表示为节点,将有效转换表示为边。我们解决了GVR的两个关键局限性:音频-运动错位以及GAN生成的转换帧中的视觉伪影。具体而言,我们(i)提出了使用潜在特征距离检索手势,以提高跨模态对齐。为确保潜在特征能有效建模语音音频与手势运动之间的关系,我们实现了层次化联合嵌入空间(AuMoCLIP);(ii)我们引入基于扩散的模型生成高质量的转换帧。我们的扩散模型Appearance Consistent Interpolation(ACInterp)基于AnimateAnyone,包括参考运动模块和全球背景流,以保持生成视频与参考视频之间的外观一致性。通过将这些组件集成到基于图的检索框架中,TANGO可靠地生成逼真且音频同步的视频,并优于所有现有的生成和检索方法。我们的代码和预训练模型可用:\url{https://pantomatrix.github.io/TANGO/}
引用
@article{arxiv.2410.04221,
title = {TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion Interpolation},
author = {Haiyang Liu and Xingchao Yang and Tomoya Akiyama and Yuantian Huang and Qiaoge Li and Shigeru Kuriyama and Takafumi Taketomi},
journal= {arXiv preprint arXiv:2410.04221},
year = {2024}
}
备注
16 pages, 8 figures