FaceChain-ImagineID:从解耦音频中自由生成高保真多样化说话人脸
计算机视觉与模式识别
2024-04-02 v2
摘要
在本文中,我们将人们听到语音、提取有意义线索并创建各种动态与音频一致的说话人脸的过程(称为“聆听与想象”)抽象为从单个音频生成高保真多样化说话人脸的任务。具体而言,这涉及两个关键挑战:一是从纠缠的音频中有效解耦身份、内容和情感;二是保持视频内多样性与视频间一致性。为解决这些问题,我们首先挖掘了人脸因素之间的复杂关系并简化了解耦过程,量身定制了渐进式音频解耦以进行准确的人脸几何与语义学习,其中每个阶段都包含一个负责特定因素的定制训练模块。其次,为了在单一模型内仅从输入音频实现视觉上多样化且音频同步的动画,我们引入了可控连贯帧生成,该机制将三个可训练适配器与冻结的 Latent Diffusion Models (LDMs) 灵活集成,以专注于保持人脸几何与语义,以及帧间的纹理和时间连贯性。通过这种方式,我们继承了 LDMs 高质量的多样化生成能力,同时以低训练成本显著提高了其可控性。大量实验证明了我们的方法在处理这一范式时的灵活性和有效性。代码将发布于 https://github.com/modelscope/facechain。
引用
@article{arxiv.2403.01901,
title = {FaceChain-ImagineID: Freely Crafting High-Fidelity Diverse Talking Faces from Disentangled Audio},
author = {Chao Xu and Yang Liu and Jiazheng Xing and Weida Wang and Mingze Sun and Jun Dan and Tianxin Huang and Siyuan Li and Zhi-Qi Cheng and Ying Tai and Baigui Sun},
journal= {arXiv preprint arXiv:2403.01901},
year = {2024}
}