中文

Tokenizing Motion:面向场景动态压缩的生成方法

计算机视觉与模式识别 2025-12-11 v4 图像与视频处理

摘要

本文提出了一种新颖的生成式视频压缩框架,利用来自常见场景中细微动态模式的先验(例如轻拂的花或水中漂浮的船只),而非依赖视频内容先验(例如说话的面孔或人类身体)。这些紧凑的运动先验 enable 一种新的超低比特率通信方法,同时在多样化场景内容上实现高质量重建。在编码器端,运动先验可通过稠密到稀疏转换被简化为紧凑表示。在解码器端,这些先验 facilitate 使用先进的基于流动的扩散模型来重建场景动态。实验结果表明,所提方法在率失真性能方面优于基于增强压缩模型(ECM)的领先方法,在场景动态序列上表现更佳。项目页面位于-https://github.com/xyzysz/GNVDC。

关键词

引用

@article{arxiv.2410.09768,
  title  = {Tokenizing Motion: A Generative Approach for Scene Dynamics Compression},
  author = {Shanzhi Yin and Zihan Zhang and Bolin Chen and Shiqi Wang and Yan Ye},
  journal= {arXiv preprint arXiv:2410.09768},
  year   = {2025}
}

备注

5page, 5 figures