中文

当 MLLMs 遇上压缩失真:面向 MLLMs 的编码范式

计算机视觉与模式识别 2025-09-30 v1

摘要

强大的多模态大型语言模型(MLLMs)通常托管在云端,其部署日益需要有效的压缩技术,以在边缘设备上以最小带宽消耗高效传输信号输入(如图像、视频)。然而,传统图像编解码器 optimized for fidelity to serve Human Visual System(HVS),不适用于 MLLMs,因为后者需要考虑 diverse downstream tasks。本文首先系统分析了压缩失形对几主流 MLLMs 的影响。我们发现:压缩失形在不同层级的图像特征上不均匀影响,导致对 MLLMs downstream tasks 的影响因其 feature-level reliance 而异。基于此发现,我们提出一种专为 MLLMs 设计的图像编解码器——CoTAM(Codec TAilored to MLLMs),用于 adaptively 保护 multi-level features,满足不同 downstream tasks 的需求。编码器利用 CLIP 的浅层注意力机制生成重要性图进行比特分配,保留关键语义区域。同时,解码器集成轻量级适配器和 multi-level loss function,确保 low-level details 与 high-level semantic context 的忠实重建,以实现 robust cross-level feature synthesis。大量实验验证了该方法在保持 MLLM tasks 性能的前提下实现最高 35.99% 的 bitrate saving,超越了以往 SOTA neural codecs。

关键词

引用

@article{arxiv.2509.24258,
  title  = {When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs},
  author = {Jinming Liu and Zhaoyang Jia and Jiahao Li and Bin Li and Xin Jin and Wenjun Zeng and Yan Lu},
  journal= {arXiv preprint arXiv:2509.24258},
  year   = {2025}
}