中文

Qffusion:通过象限网格注意力学习实现可控人像视频编辑

计算机视觉与模式识别 2025-07-29 v3

摘要

本文提出了Qffusion,一种双帧引导的人像视频编辑框架。具体来说,我们考虑“以动画促编辑”的设计原则,将Qffusion训练为一个从两张静态参考图像生成动画的通用框架,而在推理时通过应用修改后的起始帧和结束帧作为参考,可以轻松地用于人像视频编辑。利用Stable Diffusion强大的生成能力,我们提出了一种象限网格排列(QGA)方案用于潜在重排,该方案将两张参考图像的潜在编码和四个面部条件的潜在编码分别排列成四网格形式。然后,我们融合这两种模态的特征,并使用自注意力进行外观和时间学习,在QGA下联合建模不同时间的表示。我们的Qffusion无需额外网络或复杂训练阶段即可实现稳定的视频编辑,仅修改了Stable Diffusion的输入格式。此外,我们提出了一种象限网格传播(QGP)推理策略,通过递归处理参考帧和条件帧,在稳定生成长度可变的视频方面具有独特优势。通过大量实验,Qffusion在人像视频编辑上持续优于最先进技术。项目页面:https://qffusion.github.io/page/。

关键词

引用

@article{arxiv.2501.06438,
  title  = {Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning},
  author = {Maomao Li and Lijian Lin and Yunfei Liu and Ye Zhu and Yu Li},
  journal= {arXiv preprint arXiv:2501.06438},
  year   = {2025}
}

备注

19 pages