中文

VIVA: 基于奖励优化的VLM引导指令视频编辑

计算机视觉与模式识别 2025-12-19 v1

摘要

基于指令的视频编辑旨在根据自然语言指令修改输入视频,同时保持内容保真度和时间一致性。然而,现有的基于扩散的方法通常针对简单编辑操作的配对数据进行训练,这从根本上限制了它们泛化到多样和复杂的真实世界指令的能力。为了解决这一泛化差距,我们提出了VIVA,一个用于基于指令的视频编辑的可扩展框架,它利用视觉语言模型(VLM)引导的编码和奖励优化。首先,我们引入了一个基于VLM的指令器,将文本指令、源视频的第一帧和可选的参考图像编码为视觉引导的指令表示,为扩散Transformer骨干提供细粒度的空间和语义上下文。其次,我们提出一个后训练阶段Edit-GRPO,将组相对策略优化(GRPO)适配到视频编辑领域,使用相对奖励直接优化模型以实现符合指令、保持内容和美观的编辑。此外,我们提出一个数据构建流程,旨在合成生成多样、高保真的基本编辑操作配对视频-指令数据。广泛的实验表明,VIVA在指令遵循、泛化和编辑质量方面优于最先进的方法。网站:https://viva-paper.github.io

关键词

引用

@article{arxiv.2512.16906,
  title  = {VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization},
  author = {Xiaoyan Cong and Haotian Yang and Angtian Wang and Yizhi Wang and Yiding Yang and Canyu Zhang and Chongyang Ma},
  journal= {arXiv preprint arXiv:2512.16906},
  year   = {2025}
}