几何变换嵌入式Mamba用于学习视频压缩
计算机视觉与模式识别
2026-03-10 v1
摘要
尽管学习型视频压缩方法已展现出卓越性能,但大多数方法遵循混合编码范式,需要显式运动估计和补偿,导致视频压缩解决方案复杂。相反,我们引入一种基于直接变换策略的简洁而有效的视频压缩框架,即非线性变换、量化和熵编码。我们首先开发了嵌入不同几何变换的级联Mamba模块(CMM),有效探索长程空间和时间依赖性。为改善局部空间表征,我们引入了 locality refinement feed-forward 网络(LRFFN),该网络基于差分卷积 incorporated 一个混合卷积块。我们将所提CMM和LRFFN集成到压缩框架的编码器和解码器中。此外,我们提出了一个条件通道注意型熵模型,有效利用条件时序先验准确估计当前潜在特征的概率分布。大量实验表明,我们的方法在低比特率约束下,以感知质量和时序一致性优于最先进的视频压缩方法。我们的源代码和模型将在https://github.com/cshw2021/GTEM-LVC上提供。
引用
@article{arxiv.2603.07912,
title = {Geometric Transformation-Embedded Mamba for Learned Video Compression},
author = {Hao Wei and Yanhui Zhou and Chenyang Ge},
journal= {arXiv preprint arXiv:2603.07912},
year = {2026}
}