中文

S2CFormer:重新审视基于Transformer的端到端图像压缩中的率失真-延迟权衡

计算机视觉与模式识别 2025-03-25 v3 图像与视频处理

摘要

基于 Transformer 的端到端图像压缩(LIC)在解码延迟与率失真(R-D)性能之间存在次优的权衡。此外,基于前馈网络(FFN)的通道聚合模块的关键作用在很大程度上被忽视了。我们的研究表明,高效的通道聚合——而非复杂且耗时的空间操作——是实现有竞争力 LIC 模型的关键。基于这一洞察,我们开创了“S2CFormer”范式,这是一种通过简化空间操作并增强通道操作来克服先前权衡的通用架构。我们提出了 S2CFormer 的两个实例:S2C-Conv 和 S2C-Attention。这两个模型都展示了最先进的 R-D 性能和显著更快的解码速度。此外,我们还引入了 S2C-Hybrid,这是一个增强型变体,它最大限度地发挥了不同 S2CFormer 实例的优势,以实现更好的性能-延迟权衡。该模型在 Kodak、Tecnick 和 CLIC Professional Validation 数据集上超越了所有现有方法,为高效、高性能的 LIC 设立了新的基准。代码见 https://github.com/YunuoChen/S2CFormer。

关键词

引用

@article{arxiv.2502.00700,
  title  = {S2CFormer: Revisiting the RD-Latency Trade-off in Transformer-based Learned Image Compression},
  author = {Yunuo Chen and Qian Li and Bing He and Donghui Feng and Ronghua Wu and Qi Wang and Li Song and Guo Lu and Wenjun Zhang},
  journal= {arXiv preprint arXiv:2502.00700},
  year   = {2025}
}