中文

面向身份保持的人脸视频编辑:IP-FaceDiff

计算机视觉与模式识别 2025-01-14 v1

摘要

人脸视频编辑日益重要,使内容创作者能够操控面部表情和属性。然而,现有模型面临编辑质量差、计算成本高以及在各种编辑下难以保持面部身份等挑战。此外,这些模型常被限制在编辑预定义的面部属性上,这限制了其灵活性以适应多样化的编辑提示。为此,我们提出一种新型的人脸视频编辑框架,利用预训练文本到图像扩散模型的丰富潜在空间并针对人脸视频编辑任务进行微调。我们的方法引入了针对性的微调方案,使其能够实现高质量、局部、文本驱动的编辑,同时确保视频帧之间的身份一致性。此外,通过在推理阶段使用预训练的 T2I 模型,我们显著减少了编辑时间(缩短80%),同时保持视频序列中的时间一致性。我们通过在广泛的各种具有挑战性情景下进行大规模测试,包括不同头部姿态、复杂的动作序列和多样化的面部表情,评估了我们方法的有效性。我们的方法在广泛的指标和基准测试中 consistently 优于现有技术,显示出卓越的性能。

关键词

引用

@article{arxiv.2501.07530,
  title  = {IP-FaceDiff: Identity-Preserving Facial Video Editing with Diffusion},
  author = {Tharun Anand and Aryan Garg and Kaushik Mitra},
  journal= {arXiv preprint arXiv:2501.07530},
  year   = {2025}
}

备注

WACV-25 Workshop