跟随运动:面向人像编辑的通用时序一致性框架
计算机视觉与模式识别
2025-03-31 v1
摘要
预训练的条件扩散模型在图像编辑中展现出巨大的潜力。然而,它们常面临时序一致性挑战,尤其是在说话人脸领域,因为面部表情的持续变化加剧了难度。这些问题源于对单个图像的独立编辑以及编辑过程中本质性丢失的时序连续性。在本文中,我们引入一种名为 Follow Your Motion(FYM)的人像编辑时序一致性通用框架。具体而言,给定由预训练的 3D 高斯溅写模型渲染的人像图像,我们首先开发一种扩散模型,直观且天然地学习从第一帧到每一后续帧中不同尺度和像素坐标上的运动轨迹变化,从而确保时序不一致的编辑后人像继承渲染人像的运动信息。其次,为维持说话人编辑中细粒度表情的时序一致性,我们提出一种动态加权注意力机制。该机制根据地标损失在空间中为地标点分配更高权重系数,并动态更新这些权重,从而实现更一致、更精细的面部表情。大量实验表明,我们的方法在时序一致性方面优于现有方法,可用于优化和补偿一系列应用中时序不一致的输出,包括文本驱动编辑、光照调整等多种应用。
引用
@article{arxiv.2503.22225,
title = {Follow Your Motion: A Generic Temporal Consistency Portrait Editing Framework with Trajectory Guidance},
author = {Haijie Yang and Zhenyu Zhang and Hao Tang and Jianjun Qian and Jian Yang},
journal= {arXiv preprint arXiv:2503.22225},
year = {2025}
}
备注
https://anonymous-hub1127.github.io/FYM.github.io/