中文

综述:视频生成中的时空一致性

计算机视觉与模式识别 2026-02-19 v2 人工智能

摘要

视频生成旨在产生时间连贯的视觉帧序列,代表人工智能生成内容(AIGC)领域的重要进展。与静态图像生成相比,视频生成面临独特的挑战:它不仅要求高质量的单帧画面,还需要强大的时间连贯性以确保整个时空序列的一致性。尽管近年来针对视频生成中时空一致性的研究有所增加,但系统性地聚焦于这一核心问题的综述仍然相对稀缺。为填补这一空白,本文将视频生成任务视为从高维时空分布中进行序贯采样的过程,并进一步讨论时空一致性。我们对该领域的最新进展进行了系统性综述。内容涵盖多个维度,包括生成模型、特征表示、生成框架、后处理技术、训练策略、基准和评估指标,特别关注各种方法在维持时空一致性方面的机制与有效性。最后,本文探讨了该领域的未来研究方向和潜在挑战,旨在为推进视频生成技术提供有价值的见解。项目链接:https://github.com/Yin-Z-Y/A-Survey-Spatiotemporal-Consistency-in-Video-Generation。

关键词

引用

@article{arxiv.2502.17863,
  title  = {A Survey: Spatiotemporal Consistency in Video Generation},
  author = {Zhiyu Yin and Kehai Chen and Xuefeng Bai and Ruili Jiang and Juntao Li and Hongdong Li and Jin Liu and Yang Xiang and Jun Yu and Min Zhang},
  journal= {arXiv preprint arXiv:2502.17863},
  year   = {2026}
}