基于 Transformer 的端到端图像压缩与分析
计算机视觉与模式识别
2021-12-20 v1 图像与视频处理
摘要
我们提出了一种基于 Transformer 的端到端图像压缩与分析模型,面向云端的图像分类应用。与将现有的基于 Transformer 的图像分类模型直接置于图像编解码器之后不同,我们旨在重新设计 Vision Transformer (ViT) 模型,使其从压缩特征执行图像分类,并利用 Transformer 的长期信息来促进图像压缩。具体而言,我们首先用卷积神经网络建模的轻量级图像编码器替换 ViT 模型的 patchify stem(即图像分块与嵌入)。该图像编码器生成的压缩特征注入了卷积归纳偏置,并在绕过图像重建的情况下被送入 Transformer 进行图像分类。同时,我们提出一种特征聚合模块,将压缩特征与 Transformer 所选中间特征融合,并将聚合特征送入反卷积神经网络以进行图像重建。聚合特征可获得来自 Transformer 自注意力机制的长期信息,从而提升压缩性能。率失真精度优化问题最终通过两步训练策略求解。实验结果证明了所提模型在图像压缩与分类任务中的有效性。
引用
@article{arxiv.2112.09300,
title = {Towards End-to-End Image Compression and Analysis with Transformers},
author = {Yuanchao Bai and Xu Yang and Xianming Liu and Junjun Jiang and Yaowei Wang and Xiangyang Ji and Wen Gao},
journal= {arXiv preprint arXiv:2112.09300},
year = {2021}
}
备注
Accepted by AAAI 2022; Code: https://github.com/BYchao100/Towards-Image-Compression-and-Analysis-with-Transformers