中文

DiffMagicFace:面向真实视频的身份一致性人脸编辑

计算机视觉与模式识别 2026-04-16 v1

摘要

文本条件图像编辑技术近年来受到了扩散模型进步的极大推动。然而,将这些技术扩展到人脸视频编辑中,面临在源视频全程保留人脸身份特征以及确保编辑后主体在各帧之间的一致性等挑战。本文引入 DiffMagicFace,一个独特的视频编辑框架,将两种微调模型用于文本和图像控制。这两种模型在推理过程中同时运行,以生成在保持身份特征的同时无缝对齐编辑语义的视频帧。为确保编辑后视频的一致性,我们开发了一个数据集,包含展示每个被编辑主体不同人脸角度的图像。数据集的创建通过渲染技术以及随后应用优化算法实现。值得注意的是,我们的方法不依赖视频数据集,却仍能在一致性和内容方面达到高质量效果。该方法在复杂任务(如说话人视频和区分紧密相关类别)下也表现优异。使用我们框架编辑的视频与使用传统渲染软件制作的视频表现持平。通过与当前最先进方法的对比分析,我们的框架在视觉效果和定量指标方面均表现出优越性能。

关键词

引用

@article{arxiv.2604.13841,
  title  = {DiffMagicFace: Identity Consistent Facial Editing of Real Videos},
  author = {Huanghao Yin and Shenkun Xu and Kanle Shi and Junhai Yong and Bin Wang},
  journal= {arXiv preprint arXiv:2604.13841},
  year   = {2026}
}