面向视频生成的协作面部专家融合:提升大面部姿态下的身份一致性
计算机视觉与模式识别
2025-12-08 v4
摘要
当前的视频生成模型在大面部姿态下难以保持身份一致性,主要面临两个挑战:难以有效地将身份特征整合到 DiT 架构中,以及现有开源视频数据集对大面部姿态的覆盖不足。为此,我们提出了两个关键创新。首先,我们提出了协作面部专家融合 (CoFE),该方法在 DiT 主干网络中动态融合来自三个专门专家的互补信号:一个捕获跨姿态不变特征的身份专家、一个编码高层视觉语境的语义专家,以及一个保留皮肤纹理和颜色梯度等像素级属性的细节专家。其次,我们引入了数据 curated pipeline,包含三个关键组件:Face Constraints 确保大姿态覆盖多样,Identity Consistency 维持帧间稳定的身份,Speech Disambiguation 使文本描述与实际说话行为一致。该 pipeline 生成了 LaFID-180K 数据集,旨�用于身份保持的视频生成。实验结果在多个基准上表明,我们的方法在面部相似度、FID 和 CLIP 语义对齐方面显著优于 SOTA 方法。项目页面: https://rain152.github.io/CoFE/。
引用
@article{arxiv.2508.09476,
title = {Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses},
author = {Yuji Wang and Moran Li and Xiaobin Hu and Ran Yi and Jiangning Zhang and Chengming Xu and Weijian Cao and Yabiao Wang and Chengjie Wang and Lizhuang Ma},
journal= {arXiv preprint arXiv:2508.09476},
year = {2025}
}
备注
Project page: https://rain152.github.io/CoFE/