中文

V-Stylist: 通过多模态大语言模型代理的协作与反思实现视频风格化

计算机视觉与模式识别 2025-03-18 v1 人工智能

摘要

尽管视频风格化领域近期取得了进展,但大多数现有方法难以基于用户查询的开放风格描述来渲染具有复杂转换的任何视频。为了填补这一空白,我们引入了一个通用的多智能体系统 V-Stylist,采用多模态大语言模型(MLLM)的新型协作与反思范式。具体而言,V-Stylist 是一个系统化的工作流程,包含三个关键角色:(1)视频解析器将输入视频分解为多个镜头并生成其关键镜头内容的文本提示。通过简洁的视频到镜头提示范式,它使 V-Stylist 能够有效处理具有复杂转换的视频。(2)风格解析器识别用户查询中的风格,并通过风格树逐步搜索匹配的风格模型。通过稳健的思维树搜索范式,它使 V-Stylist 能够精确指定开放用户查询中模糊的风格偏好。(3)风格艺术家利用匹配的模型将所有视频镜头渲染为所需风格。通过新型的多轮自我反思范式,它使 V-Stylist 能够根据风格需求自适应地调整细节控制。通过这种模仿人类专业人士的独特设计,V-Stylist 在有效和自动视频风格化的主要挑战上取得了重大突破。此外,我们进一步构建了一个新的基准——文本驱动视频风格化基准(TVSBench),填补了评估开放用户查询下复杂视频风格化的空白。大量实验表明,V-Stylist 达到了最先进的水平,例如 V-Stylist 在总体平均指标上分别超越 FRESCO 和 ControlVideo 6.05% 和 4.51%,标志着视频风格化的重大进展。

关键词

引用

@article{arxiv.2503.12077,
  title  = {V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents},
  author = {Zhengrong Yue and Shaobin Zhuang and Kunchang Li and Yanbo Ding and Yali Wang},
  journal= {arXiv preprint arXiv:2503.12077},
  year   = {2025}
}

备注

CVPR 2025