屏显图像压缩的 Octave 多尺度残余网络 OMR-NET
图像与视频处理
2024-07-12 v1 计算机视觉与模式识别
摘要
屏幕内容 (SC) 与自然场景 (NS) 具有独特特征,如无噪声、重复图案和高对比度。针对当前学习图像压缩 (LIC) 方法对 SC 的不足之处,本文提出了用于高频和低频特征提取的改进两阶段 Octave 卷积残余块 (IToRB) ,并提出用于改进多尺度学习和非线性性的级联两阶段多尺度残余块 (CTMSRB) 。此外,我们还采用基于窗口的注意力模块 (WAM) 来捕获像素相关性,尤其是针对图像中的高对比度区域。我们还构建了一个多样化的 SC 图像压缩数据集 (SDU-SCICD2K) 用于训练,包括文本、图表、图形、动画、电影、游戏以及 SC 图像和 NS 图像的混合。实验结果表明,我们的方法更适用于 SC 数据, 在 SC 图像的速率-失真性能上优于现有的 LIC 方法。代码已公开于 https://github.com/SunshineSki/OMR Net.git。
引用
@article{arxiv.2407.08545,
title = {OMR-NET: a two-stage octave multi-scale residual network for screen content image compression},
author = {Shiqi Jiang and Ting Ren and Congrui Fu and Shuai Li and Hui Yuan},
journal= {arXiv preprint arXiv:2407.08545},
year = {2024}
}
备注
7 figures, 2 tables