中文

视频值千图:探索长视频生成的最新趋势

计算机视觉与模式识别 2025-08-06 v2 人工智能

摘要

一张图片可能传递千言万语,但由数百或数千个图像帧构成的视频则讲述更复杂的故事。尽管多模态大语言模型(MLLM)取得了显著进展,但生成长时长视频仍是一个巨大的挑战。截至目前,OpenAI 的 Sora 作为当前最先进的系统,仍限制只能生成时长最多为一分钟的视频。这种限制源于长视频生成的复杂性,这需要超越生成式 AI 技术的不仅仅是逼近密度函数,还需处理规划、故事发展以及维持空间和时间一致性等关键方面。将生成式 AI 与分治方法相结合,可能提高长视频生成的可扩展性,同时提供更大的控制力。本文对当前长视频生成的格局进行了调查,涵盖生成对抗网络(GAN)和扩散模型等基础技术、视频生成策略、大规模训练数据集、用于评估长视频的质量指标,以及为解决现有视频生成能力有限而展望的未来研究领域。我们认为本综述将为未来在长视频生成领域的进一步发展和研究提供全面的基础,提供广泛信息以指导未来进步。

关键词

引用

@article{arxiv.2412.18688,
  title  = {Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation},
  author = {Faraz Waseem and Muhammad Shahzad},
  journal= {arXiv preprint arXiv:2412.18688},
  year   = {2025}
}

备注

35 pages, 18 figures, Manuscript submitted to ACM