中文

好的噪声成就好的编辑:基于扩散的无训练视频编辑与图像和文本提示

计算机视觉与模式识别 2025-12-23 v2

摘要

我们提出了VINO,第一个基于图像和文本条件的零样本、无训练视频编辑方法。我们的方法引入了ρ\rho-start采样和膨胀双掩码来构建结构化噪声图,从而实现连贯且准确的编辑。为了进一步增强视觉保真度,我们提出了零图像引导,一种可控的负提示策略。大量实验表明,VINO忠实地将参考图像融入视频编辑中,与最先进基线相比取得了强劲性能,且无需任何测试时或实例特定训练。

关键词

引用

@article{arxiv.2506.12520,
  title  = {Good Noise Makes Good Edits: A Training-Free Diffusion-Based Video Editing with Image and Text Prompts},
  author = {Saemee Choi and Sohyun Jeong and Hyojin Jang and Jaegul Choo and Jinhee Kim},
  journal= {arXiv preprint arXiv:2506.12520},
  year   = {2025}
}