中文

可控且富有表现力的单次视频头部置换

计算机视觉与模式识别 2025-06-23 v1

摘要

本文提出了一种基于扩散模型的新型多条件可控框架,用于视频头部置换,该框架能够无缝地将来自静态图像的人类头部置于动态视频中,同时保留目标视频的原始身体和背景,并进一步允许根据需要微调置换后头部的表情和动作。现有面部置换方法主要聚焦于局部面部替换,忽略整体头部形态,而头部置换方法则在发型多样性和复杂背景方面受限,且无法在置换后修改置换头部的表情。为解决这些挑战,我们的方法通过统一的潜在扩散范式引入了几项创新策略。1)身份保持上下文融合:我们提出一种与形状无关的掩码策略,显式地将前景头部身份特征与背景/身体上下文 disentangle,结合发型增强策略以实现跨多种发型和复杂背景下的整体头部身份保持。2)面向表情的 landmarks 置换与编辑:我们提出一种解耦的3DMM驱动的置换模块,将身份、表情和头部姿态解耦,最小化输入图像中原始表情的影响,支持表情编辑。同时,我们进一步采用比例感知的置换策略,以最小化跨身份表情失真,提高置换精度。实验结果表明,我们的方法在无缝背景集成方面表现优异,能够保留源肖像的身份特征,同时展示卓越的表情传递能力,适用于真实和虚拟角色。

关键词

引用

@article{arxiv.2506.16852,
  title  = {Controllable and Expressive One-Shot Video Head Swapping},
  author = {Chaonan Ji and Jinwei Qi and Peng Zhang and Bang Zhang and Liefeng Bo},
  journal= {arXiv preprint arXiv:2506.16852},
  year   = {2025}
}

备注

Project page: https://humanaigc.github.io/SwapAnyHead/