SemanticGen: 在语义空间中生成视频
计算机视觉与模式识别
2025-12-29 v3
摘要
最先进的视频生成模型通常学习 VAE 空间中视频潜变量的分布,并使用 VAE 解码器将其映射到像素。虽然这种方法可以生成高质量的视频,但在生成长视频时存在收敛速度慢和计算成本高的问题。在本文中,我们介绍了 SemanticGen,一种通过在语义空间中生成视频来解决这些局限性的新颖解决方案。我们的主要见解是,由于视频中固有的冗余性,生成过程应首先在紧凑的高级语义空间中进行全局规划,然后添加高频细节,而不是直接使用双向注意力对大量低级视频令牌进行建模。SemanticGen 采用两阶段生成过程。在第一阶段,扩散模型生成紧凑的语义视频特征,这些特征定义了视频的全局布局。在第二阶段,另一个扩散模型以这些语义特征为条件生成 VAE 潜变量,以产生最终输出。我们观察到,与 VAE 潜空间相比,在语义空间中生成导致更快的收敛。我们的方法在扩展到长视频生成时也有效且计算高效。大量实验表明,SemanticGen 能生成高质量视频,并优于最先进的方法和强基线。
引用
@article{arxiv.2512.20619,
title = {SemanticGen: Video Generation in Semantic Space},
author = {Jianhong Bai and Xiaoshi Wu and Xintao Wang and Xiao Fu and Yuanxing Zhang and Qinghe Wang and Xiaoyu Shi and Menghan Xia and Zuozhu Liu and Haoji Hu and Pengfei Wan and Kun Gai},
journal= {arXiv preprint arXiv:2512.20619},
year = {2025}
}
备注
Project page: https://jianhongbai.github.io/SemanticGen/