中文

SPAgent:通用视频生成与编辑的自适应任务分解与模型选择

计算机视觉与模式识别 2024-12-02 v1 多智能体系统

摘要

虽然开源视频生成与编辑模型已取得显著进展,但单个模型通常仅限于特定任务,无法满足用户的多样化需求。有效协调这些模型可以解锁广泛的视频生成与编辑能力。然而,手动协调复杂且耗时,需要用户深入理解任务要求并掌握每个模型的性能、适用性和局限性,从而增加了进入门槛。为此,我们提出一种由语义规划代理(SPAgent)驱动的新型视频生成与编辑系统。SPAgent弥合了不同用户意图与有效利用现有生成模型之间的鸿沟,增强了视频生成与编辑的适应性、效率和整体质量。具体而言,SPAgent组装了一个集成最新开源图像和视频生成与编辑模型的工具库。经过我们手动标注数据集上的微调后,SPAgent能够通过我们新设计的三步框架自动协调工具进行视频生成与编辑:(1)解耦意图识别,(2)原则引导路由规划,(3)基于能力的执行模型选择。此外,我们增强了SPAgent的视频质量评估能力,使其能够在无需人工干预的情况下自主评估并纳入其工具库中的新视频生成与编辑模型。实验结果表明,SPAgent有效协调模型生成或编辑视频,凸显其在各种视频任务中的灵活性和适应性。

关键词

引用

@article{arxiv.2411.18983,
  title  = {SPAgent: Adaptive Task Decomposition and Model Selection for General Video Generation and Editing},
  author = {Rong-Cheng Tu and Wenhao Sun and Zhao Jin and Jingyi Liao and Jiaxing Huang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2411.18983},
  year   = {2024}
}