中文

几何变换嵌入式Mamba用于学习视频压缩

计算机视觉与模式识别 2026-03-10 v1

摘要

尽管学习型视频压缩方法已展现出卓越性能,但大多数方法遵循混合编码范式,需要显式运动估计和补偿,导致视频压缩解决方案复杂。相反,我们引入一种基于直接变换策略的简洁而有效的视频压缩框架,即非线性变换、量化和熵编码。我们首先开发了嵌入不同几何变换的级联Mamba模块(CMM),有效探索长程空间和时间依赖性。为改善局部空间表征,我们引入了 locality refinement feed-forward 网络(LRFFN),该网络基于差分卷积 incorporated 一个混合卷积块。我们将所提CMM和LRFFN集成到压缩框架的编码器和解码器中。此外,我们提出了一个条件通道注意型熵模型,有效利用条件时序先验准确估计当前潜在特征的概率分布。大量实验表明,我们的方法在低比特率约束下,以感知质量和时序一致性优于最先进的视频压缩方法。我们的源代码和模型将在https://github.com/cshw2021/GTEM-LVC上提供。

关键词

引用

@article{arxiv.2603.07912,
  title  = {Geometric Transformation-Embedded Mamba for Learned Video Compression},
  author = {Hao Wei and Yanhui Zhou and Chenyang Ge},
  journal= {arXiv preprint arXiv:2603.07912},
  year   = {2026}
}