DreamFactory:基于多智能体框架的多场景长视频生成突破
人工智能
2024-08-22 v1 计算与语言
计算机视觉与模式识别
软件工程
摘要
当前视频生成模型在创建短片 realistic clips 方面表现优异,但在处理长篇多场景视频时仍面临挑战。我们提出了 \texttt{DreamFactory},一个基于大语言模型的框架,用于解决这一难题。\texttt{DreamFactory} 利用多智能体协作原理和关键帧迭代设计方法,确保长视频中的一致性与风格。它运用链式思维(Chain of Thought, COT)以解决大语言模型固有的不确定性。\texttt{DreamFactory} 能够生成长篇、风格连贯且结构复杂的视频。评估这些长篇视频内容本身就面临挑战,我们提出了诸如跨场景人脸距离得分(Cross-Scene Face Distance Score)和跨场景风格一致性得分(Cross-Scene Style Consistency Score)等新型指标。为进一步推动该领域研究,我们贡献了包含超过150个人工评分视频的多场景视频数据集(Multi-Scene Videos Dataset)。
引用
@article{arxiv.2408.11788,
title = {DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework},
author = {Zhifei Xie and Daniel Tang and Dingwei Tan and Jacques Klein and Tegawend F. Bissyand and Saad Ezzini},
journal= {arXiv preprint arXiv:2408.11788},
year = {2024}
}
备注
13 pages, 8 figures