中文

UniVST:基于扩散模型的无训练局部视频风格迁移统一框架

计算机视觉与模式识别 2025-11-19 v5

摘要

本文提出了UniVST,一个基于扩散模型的局部视频风格迁移统一框架。它无需训练,相较于现有需要在整个视频上进行风格迁移的扩散方法具有显著优势。本文的工作包括:(1) 基于DDIM反向传播的点匹配掩码传递策略,无需跟踪模型即可简化模型架构;(2) 训练-free AdaIN 指导的局部视频风格化机制,同时在潜在空间和注意力水平上操作,平衡内容保真度与风格丰富性,减轻直接视频风格化常导致局部细节丢失的问题;(3) 基于像素表示中光流的滑动窗口一致平滑方案,利用光流细化预测的噪声以更新潜在空间,显著增强了风格化视频的时间一致性并降低了风格化视频中的伪影。我们的方法在定量和定性指标上均优于现有方法,能够巧妙地解决在保持主要物体风格的同时确保时间一致性和细节保留的挑战。我们的代码可在 https://github.com/QuanjianSong/UniVST 访问获取。

关键词

引用

@article{arxiv.2410.20084,
  title  = {UniVST: A Unified Framework for Training-free Localized Video Style Transfer},
  author = {Quanjian Song and Mingbao Lin and Wengyi Zhan and Shuicheng Yan and Liujuan Cao and Rongrong Ji},
  journal= {arXiv preprint arXiv:2410.20084},
  year   = {2025}
}

备注

Accepted by TPAMI 2025; Project Page: https://quanjiansong.github.io/projects/UniVST