Tokenizing Motion:面向场景动态压缩的生成方法
计算机视觉与模式识别
2025-12-11 v4 图像与视频处理
摘要
本文提出了一种新颖的生成式视频压缩框架,利用来自常见场景中细微动态模式的先验(例如轻拂的花或水中漂浮的船只),而非依赖视频内容先验(例如说话的面孔或人类身体)。这些紧凑的运动先验 enable 一种新的超低比特率通信方法,同时在多样化场景内容上实现高质量重建。在编码器端,运动先验可通过稠密到稀疏转换被简化为紧凑表示。在解码器端,这些先验 facilitate 使用先进的基于流动的扩散模型来重建场景动态。实验结果表明,所提方法在率失真性能方面优于基于增强压缩模型(ECM)的领先方法,在场景动态序列上表现更佳。项目页面位于-https://github.com/xyzysz/GNVDC。
引用
@article{arxiv.2410.09768,
title = {Tokenizing Motion: A Generative Approach for Scene Dynamics Compression},
author = {Shanzhi Yin and Zihan Zhang and Bolin Chen and Shiqi Wang and Yan Ye},
journal= {arXiv preprint arXiv:2410.09768},
year = {2025}
}
备注
5page, 5 figures