基于扩散Transformer的Image-to-Video人脸换脸桥接方案:DreamID-V
计算机视觉与模式识别
2026-01-06 v1
摘要
视频人脸换脸(VFS)需要在精心保留原始姿态、表情、光照、背景和动态信息的同时,将源身份无缝注入目标视频。现有方法在保持身份相似性和属性保持的同时难以维持时间一致性。为解决这一挑战,我们提出了一个综合框架,将Image Face Swapping(IFS)的优势无缝导入视频领域。我们首先引入一种新颖的数据管道SyncID-Pipe,对进行身份锚定的视频合成器进行预训练,并将其与IFS模型结合,用于构建双向ID四元组以实现显式监督。基于配对数据,我们提出了首个基于扩散Transformer的框架DreamID-V,采用核心的模块感知条件模块进行多模型条件的判别性注入。同时,我们提出了一种合成到真实的课程机制和身份一致性强化学习策略,以增强在挑战情境下的视觉真实性和身份一致性。为解决基准数据有限的问题,我们引入了IDBench-V,一个涵盖多样场景的全面基准。大量实验表明,DreamID-V超过了当前最先进的方法,并显示出卓越的多功能性,可无缝适应各种与换脸相关的任务。
关键词
引用
@article{arxiv.2601.01425,
title = {DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer},
author = {Xu Guo and Fulong Ye and Xinghui Li and Pengqi Tu and Pengze Zhang and Qichao Sun and Songtao Zhao and Xiangwang Hou and Qian He},
journal= {arXiv preprint arXiv:2601.01425},
year = {2026}
}
备注
Project: https://guoxu1233.github.io/DreamID-V/