中文

基于 Transformer 的图像压缩

图像与视频处理 2021-11-15 v1 计算机视觉与模式识别

摘要

本文提出了一种基于 Transformer 的图像压缩(TIC)方法,其复用了规范变分自编码器(VAE)架构,带有配对的主编解码器与超编解码器。主编码器与超编码器均由一系列神经变换单元(NTUs)构成,用以分析并聚合重要信息,从而获得输入图像更紧凑的表示;而解码器镜像编码器侧操作,从压缩码流生成像素域图像重建。每个 NTU 由一个 Swin Transformer 块(STB)和一个卷积层(Conv)组成,以最佳嵌入长程与短程信息;同时,设计了因果注意力模块(CAM)用于潜特征的自适应上下文建模,以利用超先验与自回归先验。TIC 可与最先进方法媲美,包括基于深度卷积神经网络(CNNs)的学习图像编码(LIC)方法与基于手工规则的最近批准的通用视频编码(VVC)标准帧内档,且所需模型参数少得多,例如相较领先性能的 LIC 最多减少 45%。

关键词

引用

@article{arxiv.2111.06707,
  title  = {Transformer-based Image Compression},
  author = {Ming Lu and Peiyao Guo and Huiqing Shi and Chuntong Cao and Zhan Ma},
  journal= {arXiv preprint arXiv:2111.06707},
  year   = {2021}
}