联合层次先验与自适应空间分辨率的高效神经图像压缩
计算机视觉与模式识别
2024-01-23 v4 图像与视频处理
摘要
近来,得益于最新一行研究,神经图像压缩(NIC)的性能稳步提升,达到或超越了 state-of-the-art 传统编解码器。尽管取得了显著进展,当前的 NIC 方法仍依赖基于 ConvNet 的熵编码,因其局部连接性以及日益增多的架构偏置与先验,在建模长程依赖上受限,导致模型复杂且性能不佳,解码延迟高。受基于 Transformer 的变换编码框架(即 SwinT-ChARM)的效率研究启发,我们提出对该框架进行增强:首先引入更简洁而有效的基于 Transformer 的通道自回归先验模型,从而得到绝对图像压缩 Transformer(ICT)。通过所提 ICT,我们可从潜表示中捕获全局与局部上下文,并更好地参数化量化潜变量的分布。进一步,我们利用带三明治 ConvNeXt -based 前/后处理器的可学习缩放模块,在重建更高质量图像的同时准确提取更紧凑的潜码。在基准数据集上的大量实验结果表明,相较于通用视频编码(VVC)参考编码器(VTM-18.0)与神经编解码器 SwinT-ChARM,所提框架显著改善了编码效率与解码器复杂度之间的权衡。此外,我们给出模型缩放研究以验证方法的计算效率,并进行若干客观与主观分析,凸显自适应图像压缩 Transformer(AICT)与神经编解码器 SwinT-ChARM 之间的性能差距。
引用
@article{arxiv.2307.02273,
title = {Joint Hierarchical Priors and Adaptive Spatial Resolution for Efficient Neural Image Compression},
author = {Ahmed Ghorbel and Wassim Hamidouche and Luce Morin},
journal= {arXiv preprint arXiv:2307.02273},
year = {2024}
}