中文

SMIC:基于 CLIP 字典的语义多项压缩

图像与视频处理 2024-12-09 v1 计算机视觉与模式识别 多媒体

摘要

语义压缩是一种将失真度量(通常为均方误差 MSE)替换为语义保真度度量的压缩方案,正变得越来越流行。大多数最近的语义压缩方案依赖于基础模型 CLIP。在本工作中,我们将此类方案扩展至图像集合压缩,在编码阶段考虑了项间冗余。为此,我们首先表明 CLIP 的潜在空间允许轻松的语义加减运算。基于此性质,我们定义了一个基于字典的多项编解码器,在压缩率上优于最先进的生成式编解码器,约为每张图像 10510^{-5} BPP,同时不牺牲语义保真度。我们还表明,所学字典具有语义性质,并作为图像语义内容的语义投影器发挥作用。

关键词

引用

@article{arxiv.2412.05035,
  title  = {SMIC: Semantic Multi-Item Compression based on CLIP dictionary},
  author = {Tom Bachard and Thomas Maugey},
  journal= {arXiv preprint arXiv:2412.05035},
  year   = {2024}
}

备注

12 pages, 14 figures, 3 tables, journal paper, preprint