中文

DirectSwap:面向表情一致视频头部换脸的无掩码跨身份训练与基准测试

计算机视觉与模式识别 2025-12-11 v1

摘要

视频头部换脸旨在用参考图像的头部(包括面部身份、头部形状和发型)替换视频主体的整个头部,同时保留目标身体、背景和运动动态。由于缺乏真值配对换脸数据,先前的方法通常在视频内同一个人的跨帧对上进行训练,并依赖基于掩码的修复来缓解身份泄露。除了潜在的边界伪影外,这种范式难以恢复被掩码遮挡的关键线索,如面部姿态、表情和运动动态。为了解决这些问题,我们提示视频编辑模型为现有视频合成新头部作为虚假换脸输入,同时保持帧同步的面部姿态和表情。这生成了 HeadSwapBench,这是第一个用于视频头部换脸的跨身份配对数据集,支持使用真实输出进行训练(\TrainNum{} 个视频)和基准测试(\TestNum{} 个视频)。利用这种配对监督,我们提出了 DirectSwap,一个无掩码的直接视频头部换脸框架,该框架将图像 U-Net 扩展为带有运动模块和条件输入的视频扩散模型。此外,我们引入了运动与表情感知重建(MEAR)损失,该损失利用帧差幅度和面部关键点邻近度对每个像素的扩散损失进行重新加权,从而增强运动和表情的跨帧一致性。大量实验表明,DirectSwap 在多样化的自然视频场景中实现了 SOTA 的视觉质量、身份保真度以及运动和表情一致性。我们将发布源代码和 HeadSwapBench 数据集以促进未来的研究。

关键词

引用

@article{arxiv.2512.09417,
  title  = {DirectSwap: Mask-Free Cross-Identity Training and Benchmarking for Expression-Consistent Video Head Swapping},
  author = {Yanan Wang and Shengcai Liao and Panwen Hu and Xin Li and Fan Yang and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2512.09417},
  year   = {2025}
}