中文

面向保真度-感知平衡图像压缩的双潜空间协同解码

计算机视觉与模式识别 2026-05-15 v1

摘要

学习型图像压缩(LIC)越来越要求重建结果在广泛的比特率范围内平衡失真保真度与感知真实性。然而,大多数现有方法仍依赖单一的压缩潜空间表示来同时承载结构细节、语义线索和感知先验,要求同一潜空间表示服务于多种潜在冲突的角色。这种矛盾在不同潜空间范式中显而易见:标量量化(SQ)连续潜空间提供速率可缩放的保真度,但在低速率下倾向于丢失感知细节;而向量量化(VQ)离散 token 保留了紧凑的语义线索,但结构保真度和比特率可缩放性受限。为解决此问题,我们提出混合解码器专家,一个双潜空间协同解码框架,将重建职责分解到互补的潜空间范式中。具体而言,MoDE 将 SQ 分支视为面向保真度的专家,将 VQ 分支视为面向感知的专家,并通过两个解码器端模块协调它们:专家特定增强(ESE)保留分支特定的专家参考,跨专家调制(CEM)在重建过程中实现选择性互补迁移。由此产生的框架支持在共享双流比特流下进行选择性跨潜空间协作,并实现保真度锚定与感知锚定的解码。大量实验表明,在宽比特率范围内,MoDE 比代表性的面向失真、面向感知、生成式和双潜空间基线取得了更优的保真度-感知平衡,突显了解码器端专家协作是面向宽范围保真度-感知平衡 LIC 的有效设计。

关键词

引用

@article{arxiv.2605.14391,
  title  = {Dual-Latent Collaborative Decoding for Fidelity-Perception Balanced Image Compression},
  author = {Qi Mao and Zijian Wang and Zhengxue Cheng and Lingyu Zhu and Siwei Ma},
  journal= {arXiv preprint arXiv:2605.14391},
  year   = {2026}
}