基于结构噪声初始化和引导的无调参指令式视频编辑
计算机视觉与模式识别
2026-05-18 v1 人工智能
摘要
视频编辑面临的挑战显著。虽然一系列无调参方法规避了大量数据收集和模型训练的需求,但往往 underutilize 噪声潜在空间中蕴含的丰富信息,导致结果令人不满意。为此,我们提出了一个无调参、基于指令的视频编辑框架。我们从噪声潜在的角度出发,设计了结构噪声初始化策略 (SNIS),通过为编辑区域分配更高的噪声水平以促进内容变更,为未编辑区域分配更低的噪声水平以维持内容一致性,从而确保出色的编辑起始点。我们引入了噪声引导机制 (NGM),该机制利用生成模型中的视频先验,有效地将噪声潜在中的丰富信息整合以指导去噪过程,从而保持未编辑内容和整体视觉一致性。实验表明,我们提出的方法在视觉质量和性能方面均实现了更佳的表现和最先进的水平。
引用
@article{arxiv.2605.15533,
title = {Tuning-free Instruction-based Video Editing Via Structural Noise Initialization and Guidance},
author = {Song Wu and Xinyu Chen and Qian Wang and Liang Li and Zili Yi and Junlan Feng},
journal= {arXiv preprint arXiv:2605.15533},
year = {2026}
}
备注
Accepted by ICIP 2026