中文

ReSyncer:用于统一音视频同步面部表演者的基于风格生成器的重构

计算机视觉与模式识别 2024-08-07 v1 图形学 多媒体

摘要

利用给定音频进行唇同步视频是各种应用的基础,包括虚拟主持人或表演者的创建。尽管近期研究利用不同技术探索高保真唇同步,但它们面向任务的模型要么需要长期视频进行片段特定训练,要么保留可见的伪影。本文提出一个统一且有效的框架ReSyncer,用于同步广义的音视频面部信息。关键设计是重新审视并重构基于风格的生成器,以高效采用由原理驱动的注入风格的Transformer预测的三维面部动态。通过简单地重新配置噪声空间和风格空间内的信息插入机制,我们的框架通过统一训练融合运动与外观。大量实验表明,ReSyncer不仅能根据音频生成高保真唇同步视频,还支持多种适用于创建虚拟主持人和表演者的引人注目的特性,包括快速个性化微调、视频驱动的唇同步、说话风格的迁移,甚至换脸。资源可在 https://guanjz20.github.io/projects/ReSyncer 获取。

关键词

引用

@article{arxiv.2408.03284,
  title  = {ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial Performer},
  author = {Jiazhi Guan and Zhiliang Xu and Hang Zhou and Kaisiyuan Wang and Shengyi He and Zhanwang Zhang and Borong Liang and Haocheng Feng and Errui Ding and Jingtuo Liu and Jingdong Wang and Youjian Zhao and Ziwei Liu},
  journal= {arXiv preprint arXiv:2408.03284},
  year   = {2024}
}

备注

Accepted to European Conference on Computer Vision (ECCV), 2024. Project page: https://guanjz20.github.io/projects/ReSyncer