中文

VFace:面向扩散模型视频人脸替换的无训练方法

计算机视觉与模式识别 2026-02-20 v2

摘要

我们提出一种无需训练、即插即用的方法,称为VFace,用于视频高质量人脸替换。它可无缝集成到基于扩散模型构建的图像级人脸替换方法中。首先,我们引入频谱注意力插值技术,以促进生成并保持关键身份特征。其次,我们通过即插即用的注意力注入实现目标结构引导,以更好地对齐来自目标帧的结构特征。第三,我们提出基于流引导的注意力时序平滑机制,在不修改底层扩散模型的前提下,实现时空一致性,减少通常在逐帧生成中遇到的时序不一致性。该方法无需额外训练或视频特定的微调。广泛实验表明,我们的方法在时序一致性和视觉保真度方面显著提升,提供了实用且模块化的视频级人脸替换解决方案。我们的代码已公开于https://github.com/Sanoojan/VFace。

关键词

引用

@article{arxiv.2602.07835,
  title  = {VFace: A Training-Free Approach for Diffusion-Based Video Face Swapping},
  author = {Sanoojan Baliah and Yohan Abeysinghe and Rusiru Thushara and Khan Muhammad and Abhinav Dhall and Karthik Nandakumar and Muhammad Haris Khan},
  journal= {arXiv preprint arXiv:2602.07835},
  year   = {2026}
}

备注

Accepted at WACV 2026