具有一维潜在表示的生成式视频压缩
计算机视觉与模式识别
2026-03-17 v1
摘要
近期生成式视频编解码器(GVC)的进展通常将视频编码为二维潜在网格,并采用高容量的生成式解码器进行重建。然而,这一范式在充分利用时空冗余方面仍存在两个关键挑战:在空间维度上,二维潜在网格由于其刚性结构不可避免地保留了帧内冗余,相邻块保持高度相似,从而需要更高的比特率。在时间维度上,二维潜在网格难以以紧凑且语义连贯的方式建模长期相关性,因为它阻碍了跨帧的共同内容聚合。为解决这些局限性,我们提出了一维(1D)潜在表示的生成式视频压缩方法(GVC1D)。GVC1D将视频数据编码为极端紧凑的一维潜在token,条件化于短期和长期上下文。在没有刚性二维空间对应的情况下,这些一维潜在token可以自适应地关注语义区域,并自然地促进token缩减,从而降低空间冗余。此外,所提出的1D记忆提供了语义丰富且计算成本低的长期上下文,从而进一步降低了时间冗余。实验结果表明,GVC1D实现了优越的压缩效率,在HEVC Class B数据集上,在LPIPS指标下实现了60.4%的比特率降低,在DISTS指标下实现了68.8%的比特率降低,超越了先前的视频压缩方法。项目地址:https://gvc1d.github.io
引用
@article{arxiv.2603.15302,
title = {Generative Video Compression with One-Dimensional Latent Representation},
author = {Zihan Zheng and Zhaoyang Jia and Naifu Xue and Jiahao Li and Bin Li and Zongyu Guo and Xiaoyi Zhang and Zhenghao Chen and Houqiang Li and Yan Lu},
journal= {arXiv preprint arXiv:2603.15302},
year = {2026}
}
备注
CVPR2026