MRT:基于混合RWKV-Transformer学习紧凑表征用于极端图像压缩
计算机视觉与模式识别
2025-11-17 v2
摘要
近期在极端图像压缩领域的进展表明,将像素数据映射到高度紧凑的潜在表征空间可显著提升编码效率。然而,大多数现有方法通过卷积神经网络(CNN)或Swin Transformer压缩图像至二维潜在空间,往往保留大量空间冗余,从而限制整体压缩性能。本文提出一种新型混合RWKV-Transformer(MRT)架构,通过协同集成基于线性注意力的RWKV与基于自注意力的Transformer模型的互补优势,将图像编码至更紧凑的二维潜在表征。具体而言,MRT将每张图像划分为固定大小的窗口,利用RWKV模块捕获跨窗口的全局依赖关系,并采用Transformer模块建模每个窗口内的局部冗余。层次化注意力机制使得在一维域中实现更高效和更紧凑的表征学习。为进一步提升压缩效率,我们引入了专为MRT中中间一维潜在特征结构特性设计的专用RWKV压缩模型(RCM)。在标准图像压缩基准测试中进行大量实验验证了我们方法的有效性。本文提出的MRT框架在每像素位率低于0.02位(bpp)时,始终实现了优于现有方法的重建质量。基于DISTS指标的定量结果显示,MRT在柯克(Kodak)和CLIC2020测试数据集上分别比最先进的二维架构GLC高出43.75%和30.59%的比特率节省。
关键词
引用
@article{arxiv.2511.06717,
title = {MRT: Learning Compact Representations with Mixed RWKV-Transformer for Extreme Image Compression},
author = {Han Liu and Hengyu Man and Xingtao Wang and Wenrui Li and Debin Zhao},
journal= {arXiv preprint arXiv:2511.06717},
year = {2025}
}