AICT:一种自适应图像压缩 Transformer
计算机视觉与模式识别
2023-07-13 v1 图像与视频处理
摘要
受基于 Transformer 的变换编码框架(即 SwinT-ChARM)的效率研究启发,我们提出增强后者:首先,采用更简洁而有效的基于 Transformer 的通道自回归先验模型,从而得到一种绝对图像压缩 Transformer(ICT)。当前仍依赖 ConvNet 熵编码的方法因其局部连接性以及日益增多的架构偏置与先验,在长程建模依赖上受限。相反,所提 ICT 能从潜表示中捕获全局与局部上下文,并更好地参数化量化潜变量的分布。进一步,我们利用带三明治 ConvNeXt 基前/后处理器的可学习缩放模块,以准确提取更紧凑潜表示并重建更高质量图像。在基准数据集上的大量实验结果表明,所提自适应图像压缩 Transformer(AICT)框架相较通用视频编码(VVC)参考编码器(VTM-18.0)与神经编解码器 SwinT-ChARM,显著改善了编码效率与解码器复杂度之间的权衡。
引用
@article{arxiv.2307.06091,
title = {AICT: An Adaptive Image Compression Transformer},
author = {Ahmed Ghorbel and Wassim Hamidouche and Luce Morin},
journal= {arXiv preprint arXiv:2307.06091},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2307.02273