EchoVideo:通过多模态特征融合实现身份保持的人类视频生成
计算机视觉与模式识别
2025-02-28 v2
摘要
近期视频生成技术的快速发展显著推动了各类下游应用,尤其是身份保持视频生成(IPT2V)。然而,现有方法在“复制-粘贴”痕迹和低相似性方面存在困难,主要源于其依赖低层次面部图像信息。这种依赖会导致面部外观僵化,并引入不相关细节的痕迹。为此,我们提出 EchoVideo 方案,包含两个关键策略:(1)身份图像-文本融合模块(IITF),整合文本中的高阶语义特征,捕获干净的面部身份表征,同时剔除遮挡、姿态和光照变化,以避免引入痕迹;(2)两阶段训练策略,在第二个阶段中引入随机方法,随机利用浅层面部信息。目标是平衡浅层特征提供的保真度提升,同时减轻其过度依赖。该策略鼓励模型在训练中优先利用高阶特征,从而培育更稳健的面部身份表征。EchoVideo 有效保留面部身份,保持全身完整。大量实验表明,它在生成高质量、可控性和保真度视频方面取得优异成绩。
引用
@article{arxiv.2501.13452,
title = {EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion},
author = {Jiangchuan Wei and Shiyue Yan and Wenfeng Lin and Boyuan Liu and Renjie Chen and Mingyu Guo},
journal= {arXiv preprint arXiv:2501.13452},
year = {2025}
}