中文

用于学习图像压缩的紧凑混合卷积-频率状态空间网络

计算机视觉与模式识别 2026-04-13 v2

摘要

学习图像压缩(LIC)近期受益于基于Transformer和状态空间模型(SSM)的背bone用于建模长程依赖关系。然而, 前者通常导致二次复杂度, 后者通过将二维特征展平为一维序列常破坏邻域连续性。为此, 本文提出了紧凑混合卷积和频率状态空间网络(HCFSSNet)用于LIC。HCFSSNet将卷积层用于局部细节建模, 结合Vision Frequency State Space(VFSS)块实现补充的长程上下文聚合。具体而言, VFSS块包含Vision Omni-directional Neighborhood State Space(VONSS)模块, 沿水平、垂直和对角线方向扫描特征以更好地保持二维邻域关系; 以及Adaptive Frequency Modulation Module(AFMM), 用于基于离散余弦变换的自适应重加权频率分量。此外, 本文在超先验路径中引入Frequency Swin Transformer Attention Module(FSTAM)以增强频率感知侧信息建模。在基准数据集上的实验表明, 所提出的HCFSSNet在最新LIC编解码器中实现了具竞争力的速率失真性能。源代码和模型将公开提供。

关键词

引用

@article{arxiv.2511.20151,
  title  = {A Compact Hybrid Convolution--Frequency State Space Network for Learned Image Compression},
  author = {Haodong Pan and Hao Wei and Yusong Wang and Nanning Zheng and Caigui Jiang},
  journal= {arXiv preprint arXiv:2511.20151},
  year   = {2026}
}

备注

20 pages, 11 figures