中文

DreamFactory:基于多智能体框架的多场景长视频生成突破

人工智能 2024-08-22 v1 计算与语言 计算机视觉与模式识别 软件工程

摘要

当前视频生成模型在创建短片 realistic clips 方面表现优异,但在处理长篇多场景视频时仍面临挑战。我们提出了 \texttt{DreamFactory},一个基于大语言模型的框架,用于解决这一难题。\texttt{DreamFactory} 利用多智能体协作原理和关键帧迭代设计方法,确保长视频中的一致性与风格。它运用链式思维(Chain of Thought, COT)以解决大语言模型固有的不确定性。\texttt{DreamFactory} 能够生成长篇、风格连贯且结构复杂的视频。评估这些长篇视频内容本身就面临挑战,我们提出了诸如跨场景人脸距离得分(Cross-Scene Face Distance Score)和跨场景风格一致性得分(Cross-Scene Style Consistency Score)等新型指标。为进一步推动该领域研究,我们贡献了包含超过150个人工评分视频的多场景视频数据集(Multi-Scene Videos Dataset)。

关键词

引用

@article{arxiv.2408.11788,
  title  = {DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework},
  author = {Zhifei Xie and Daniel Tang and Dingwei Tan and Jacques Klein and Tegawend F. Bissyand and Saad Ezzini},
  journal= {arXiv preprint arXiv:2408.11788},
  year   = {2024}
}

备注

13 pages, 8 figures