中文

CMC-Bench:面向视觉信号压缩的新范式

计算机视觉与模式识别 2024-06-14 v1 图像与视频处理

摘要

超低比特率图像压缩是一个具有挑战性和要求的主题。随着大型多模态模型(LMM)的发展,一种基于跨模态压缩(CMC)的范式,即图像-文本-图像,涌现出来。与传统编解码器相比,这种语义级别的压缩可以将图像数据大小压缩到 0.1% 甚至更低,具有强大的潜在应用前景。然而,CMC 在与原始图像的一致性和感知质量方面存在某些缺陷。为此,我们引入 CMC-Bench,这是一个衡量图像到文本(I2T)和文本到图像(T2I)模型协同性能的基准测试。该基准测试分别覆盖 18,000 张和 40,000 张图像,用于验证 6 种主流 I2T 和 12 种 T2I 模型,包括 160,000 条由人类专家标注的主观偏好分数。在超低比特率下,本文证明了某些 I2T 和 T2I 模型组合的组合超过了最先进的视觉信号编解码器;同时,它指出了 LMM 在压缩任务中还能进一步优化的方向。我们鼓励 LMM 开发者参与此测试,以推动视觉信号编解码协议的演进。

关键词

引用

@article{arxiv.2406.09356,
  title  = {CMC-Bench: Towards a New Paradigm of Visual Signal Compression},
  author = {Chunyi Li and Xiele Wu and Haoning Wu and Donghui Feng and Zicheng Zhang and Guo Lu and Xiongkuo Min and Xiaohong Liu and Guangtao Zhai and Weisi Lin},
  journal= {arXiv preprint arXiv:2406.09356},
  year   = {2024}
}