基于生成式2D高斯溅射的通用视频分词
计算机视觉与模式识别
2025-08-18 v1
摘要
视频分词过程对广泛的视频处理任务至关重要。大多数现有方法直接将视频转换为固定网格和块状标记,这些方法在可靠性方面有限。在空间上,均匀分配固定数量的标记常常导致在低信息区域进行过度编码。在时间上,在没有明确区分静态和动态内容的情况下,降低冗余仍具有挑战。本文提出了基于生成式2D高斯溅射(2DGS)策略的通用视频标记器(Gaussian Video Transformer, GVT)。我们首先从视频剪辑中提取刚性特征,并通过我们提出的时空高斯嵌入(STGE)机制以前馈方式表示为一组2D高斯。这种生成式2D高斯不仅通过在光栅化期间分配更高(或更低)的渲染权重来增强空间适应性——针对信息更丰富(或更少)的区域,还通过避免每个视频的优化来提高泛化性。在增强时空可靠性方面,我们引入了高斯集分区(GSP)策略,将2D高斯分为静态和动态集合,显式建模在不同时间步之间共享的静态内容以及特定于每个时间步的动态内容,从而实现紧凑表示。我们主要在视频重建上评估GVT,同时也评估其在动作识别和压缩方面的性能,使用UCF101、Kinetics和DAVIS数据集。广泛的实验表明,GVT实现了领先的视频重建质量,在动作识别方面优于基线MAGVIT-v2,在压缩方面实现了相当水平的性能。
引用
@article{arxiv.2508.11183,
title = {Versatile Video Tokenization with Generative 2D Gaussian Splatting},
author = {Zhenghao Chen and Zicong Chen and Lei Liu and Yiming Wu and Dong Xu},
journal= {arXiv preprint arXiv:2508.11183},
year = {2025}
}