中文

ViFeEdit:面向视频扩散转换器的无视频调优器

计算机视觉与模式识别 2026-03-17 v1

摘要

扩散转换器 (DiTs) 在图像和视频生成中展现出惊人的规模和质量,促使日益关注将其扩展到可控生成和编辑任务。然而,与图像版本相比,视频控制和编辑的进展仍有限,这主要源于缺乏配对视频数据以及训练视频扩散模型的高计算成本。在本文中,我们提出一种无视频调优框架,称为 ViFeEdit,用于视频扩散转换器。该方法无需任何形式的视频训练数据,即可实现对 video 生成和编辑的多样化适应,仅凭 2D 图像即可。我们方法的核心是一种架构重参数化,将空间独立性从现代视频扩散转换器中的完整 3D 注意力中解耦,从而仅凭最小的额外参数即可实现视觉忠实的编辑,同时保持时间一致性。此外,该设计在具有独立时间步嵌入的双路径管道中运行,能够适应多样化的条件信号。广泛的实验表明,我们的方法仅凭在 2D 图像数据上的最小训练即可为可控 video 生成和编辑带来有前景的效果。代码已公开于 https://github.com/Lexie-YU/ViFeEdit。

关键词

引用

@article{arxiv.2603.15478,
  title  = {ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer},
  author = {Ruonan Yu and Zhenxiong Tan and Zigeng Chen and Songhua Liu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2603.15478},
  year   = {2026}
}

备注

Working in progress, code is at https://github.com/Lexie-YU/ViFeEdit