面向学习型图像压缩的内容感知 Mamba
计算机视觉与模式识别
2026-03-18 v6
摘要
近期的学习型图像压缩(LIC)利用 Mamba 风格的状态空间模型(SSM)以线性复杂度获得全局感受野。然而,标准的 Mamba 在严格的因果性约束下采用与内容无关的、预定义的光栅(或多方向)扫描方式。这种刚性限制了其有效消除内容相关但空间上相距较远的 token 之间冗余的能力。我们提出内容感知 Mamba(CAM),这是一种能够根据图像内容动态调整处理过程的 SSM。具体而言,CAM 通过两项新机制克服了先前的局限。首先,它以内容自适应的 token 置换策略取代了刚性扫描,从而优先促进内容相似 token 之间的交互,无论其位置如何。其次,它通过向状态空间模型中注入样本特定的全局先验,克服了序列依赖性,从而在无需多方向扫描的情况下有效缓解了严格的因果性。这些创新使 CAM 能够在保持计算效率的同时更好地捕获全局冗余。我们基于内容感知 Mamba 的 LIC 模型(CMIC)取得了当前最优的率失真性能,在 Kodak、Tecnick 和 CLIC 数据集上相较 VTM-21.0 分别在 BD-rate 上节省了 15.91%、21.34% 和 17.58%。代码将在 https://github.com/UnoC-727/CMIC 发布。
引用
@article{arxiv.2508.02192,
title = {Content-Aware Mamba for Learned Image Compression},
author = {Yunuo Chen and Zezheng Lyu and Bing He and Hongwei Hu and Qi Wang and Yuan Tian and Li Song and Wenjun Zhang and Guo Lu},
journal= {arXiv preprint arXiv:2508.02192},
year = {2026}
}
备注
ICLR2026 poster