中文

GVCC: 基于码本驱动随机修正流的零样本视频压缩

计算机视觉与模式识别 2026-05-01 v3 人工智能

摘要

在超低码率下,高保真重建需要从后验分布中采样合理的视频,而非回归到过平滑的条件均值。我们提出生成视频码本编解码器(GVCC),一个零样本框架,其中预训练的视频生成模型直接作为解码器,传输的比特流指定其生成轨迹。现代修正流视频模型通常使用确定性ODE求解器进行采样,这没有每步的随机通道用于传输压缩信息。GVCC通过将确定性流采样器转换为等效的边际保持随机过程来解决此问题,使得信息可以通过编码每步的随机创新来传输。与图像不同,视频引入了更长的时间依赖和更多样的条件模式。我们以三种实用模式实例化GVCC:文本到视频(T2V)无参考帧,自回归图像到视频(I2V)带尾部潜在修正,以及首尾帧到视频(FLF2V)带边界共享的图像组(GOP)链式结构。在UVG数据集上,GVCC在三个代表性码率区间(低至约0.003 bpp)中实现了评估基线中最低的LPIPS,相比DCVC-RT在匹配码率下LPIPS降低65%。

关键词

引用

@article{arxiv.2603.26571,
  title  = {GVCC: Zero-Shot Video Compression via Codebook-Driven Stochastic Rectified Flow},
  author = {Ziyue Zeng and Xun Su and Haoyuan Liu and Bingyu Lu and Yui Tatsumi and Hiroshi Watanabe},
  journal= {arXiv preprint arXiv:2603.26571},
  year   = {2026}
}

备注

9 pages, 3 figures