中文

EditDuet:一个用于视频非线性编辑的多智能体系统

计算机视觉与模式识别 2025-09-16 v1

摘要

视频编辑与组装的自动化工具应用范围广泛,从电影制作、广告到社交媒体内容创作。以往的视编辑工作主要侧重于检索或用户界面,将实际的编辑工作留给用户。相比之下,我们提出自动化视频编辑的核心任务,并将其形式化为一个顺序决策过程。我们的方法是一个多智能体方法。我们设计了一个编辑智能体和一个评论智能体。编辑智能体接收一组视频片段以及自然语言指令作为输入,并使用视频编辑软件中常见的工具来生成编辑后的序列。另一方面,评论智能体根据生成的序列向编辑提供自然语言反馈,如果序列令人满意,则对其进行渲染。我们引入了一种基于学习的方法,以实现跨专业智能体的有效通信,从而解决语言驱动的视频编辑任务。最后,我们探索了一种以LLM作为评判标准的指标来评估视频编辑系统的质量,并将其与一般人类偏好进行比较。我们通过用户研究,定性和定量地评估了我们系统输出的视频序列,发现我们的系统在覆盖率、时间约束满足度和人类偏好方面远超现有方法。

关键词

引用

@article{arxiv.2509.10761,
  title  = {EditDuet: A Multi-Agent System for Video Non-Linear Editing},
  author = {Marcelo Sandoval-Castaneda and Bryan Russell and Josef Sivic and Gregory Shakhnarovich and Fabian Caba Heilbron},
  journal= {arXiv preprint arXiv:2509.10761},
  year   = {2025}
}

备注

SIGGRAPH 2025