VEGGIE: 基于指令接地生成的教学编辑与推理视频概念
计算机视觉与模式识别
2025-10-28 v3 人工智能
计算与语言
摘要
近期的视频扩散模型增强了视频编辑能力,但在统一框架内处理教学编辑和多样化任务(如添加、删除、更改)仍然具有挑战性。本文提出 VEGGIE(Video Editor with Grounded Generation from Instructions),一个简单的端到端框架,统一了基于多样化用户指令的视频概念编辑、接地和推理。具体而言,给定一个视频和文本查询,VEGGIE 首先利用多模态大语言模型(MLLM)解析指令中的用户意图并将其接地到视频上下文,生成针对像素空间响应的逐帧接地任务查询。随后,扩散模型将这些计划渲染并生成与用户意图一致的视频。为支持多样化任务和复杂指令,我们采用课程学习策略:先利用大规模教学图像编辑数据对 MLLM 和视频扩散模型进行对齐,再在高质量多任务视频数据上进行端到端微调。此外,我们引入了一种新颖的数据合成流水线,通过利用图像到视频模型注入动态,将静态图像数据转化为多样化、高质量的视频编辑样本。VEGGIE 在不同编辑技能的教学视频编辑中表现出色,作为通用模型超越了最佳教学基线,而其他模型在多任务处理上则力不从心。VEGGIE 在视频对象接地和推理分割方面同样表现卓越,其他基线方法均告失败。我们进一步揭示了多任务之间的相互促进关系,并展示了零样本多模态教学编辑和上下文视频编辑等有前景的应用。
引用
@article{arxiv.2503.14350,
title = {VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation},
author = {Shoubin Yu and Difan Liu and Ziqiao Ma and Yicong Hong and Yang Zhou and Hao Tan and Joyce Chai and Mohit Bansal},
journal= {arXiv preprint arXiv:2503.14350},
year = {2025}
}
备注
ICCV 2025; First three authors contributed equally. Project page: https://veggie-gen.github.io/