面向长叙事视频生成的 VideoAuteur
计算机视觉与模式识别
2025-06-10 v2
摘要
最近的视频生成模型在生成持续数秒的高质量视频片段方面显示出有前景的成果。然而,这些模型在生成能够传递清晰且信息丰富事件的长序列方面面临挑战,限制了其支持连贯叙事的能力。在本文中,我们提出了一个旨在推动烹饪领域长篇叙事生成的大规模烹饪视频数据集。我们使用最先进的视觉-语言模型 (VLM) 和视频生成模型分别验证了我们提议数据集在视觉保真度和文本标题准确性方面的质量。我们进一步引入了长叙事视频导演来增强生成视频中的视觉和语义连贯性,并强调对视觉嵌入对齐的重要性,以实现更好的整体视频质量。我们的方法在生成视觉细节丰富且语义对齐的关键帧方面实现了显著的改进,支持将文本和图像嵌入集成到视频生成过程中的微调技术。项目页面: https://videoauteur.github.io/
引用
@article{arxiv.2501.06173,
title = {VideoAuteur: Towards Long Narrative Video Generation},
author = {Junfei Xiao and Feng Cheng and Lu Qi and Liangke Gui and Jiepeng Cen and Zhibei Ma and Alan Yuille and Lu Jiang},
journal= {arXiv preprint arXiv:2501.06173},
year = {2025}
}
备注
Preprint, https://videoauteur.github.io/; V2: Method is updated