细节决定成败:基于窗口注意力机制的图像压缩
图像与视频处理
2022-04-12 v1 计算机视觉与模式识别
摘要
学习型图像压缩方法已展现出优于经典图像压缩标准的率失真性能。大多数现有学习型图像压缩模型基于卷积神经网络(CNN)。尽管贡献显著,CNN模型的一个主要缺陷是其结构并非为捕获局部冗余而设计,尤其是非重复纹理,这严重影响了重建质量。因此,如何充分利用全局结构与局部纹理成为基于学习的图像压缩的核心问题。受Vision Transformer (ViT) 和 Swin Transformer 近期进展的启发,我们发现将局部感知注意力机制与全局关联特征学习相结合可满足图像压缩中的这一期望。在本文中,我们首先广泛研究了多种注意力机制对局部特征学习的影响,随后引入了一种更直接而有效的基于窗口的局部注意力模块。所提出的基于窗口的注意力非常灵活,可作为即插即用组件增强CNN和Transformer模型。此外,我们提出了一种新颖的对称Transformer (STF) 框架,在降采样编码器和上采样解码器中均采用纯Transformer模块。大量实验评估表明,所提方法有效且优于当前最先进的方法。代码公开于 https://github.com/Googolxx/STF。
引用
@article{arxiv.2203.08450,
title = {The Devil Is in the Details: Window-based Attention for Image Compression},
author = {Renjie Zou and Chunfeng Song and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2203.08450},
year = {2022}
}
备注
Accepted by CVPR 2022