MambaVC:基于选择性状态空间的学习型视觉压缩
图像与视频处理
2024-05-29 v3 计算机视觉与模式识别
信息论
math.IT
摘要
学习型视觉压缩是多媒体领域一项重要且活跃的任务。现有方法探索了各种基于CNN和Transformer的设计来建模内容分布并消除冗余,但在平衡效能(即率失真权衡)和效率方面仍然存在挑战。最近,状态空间模型(SSM)因其长程建模能力和效率而展现出前景。受此启发,我们首次探索将SSM用于视觉压缩。我们提出了MambaVC,一个基于SSM的简单、强大且高效的压缩网络。MambaVC开发了一个视觉状态空间(VSS)模块,其中包含一个二维选择性扫描(2DSS)模块,作为每次下采样后的非线性激活函数,这有助于捕获信息丰富的全局上下文并增强压缩效果。在压缩基准数据集上,MambaVC以更低的计算和内存开销实现了优越的率失真性能。具体来说,在Kodak数据集上,它分别比CNN和Transformer变体高出9.3%和15.6%,同时计算量减少42%和24%,内存节省12%和71%。MambaVC在高分辨率图像上表现出更大的改进,突显了其在实际应用中的潜力和可扩展性。我们还提供了不同网络设计的全面比较,强调了MambaVC的优势。代码可在https://github.com/QinSY123/2024-MambaVC获取。
引用
@article{arxiv.2405.15413,
title = {MambaVC: Learned Visual Compression with Selective State Spaces},
author = {Shiyu Qin and Jinpeng Wang and Yimin Zhou and Bin Chen and Tianci Luo and Baoyi An and Tao Dai and Shutao Xia and Yaowei Wang},
journal= {arXiv preprint arXiv:2405.15413},
year = {2024}
}
备注
17pages,15 figures