中文

面向高性能压缩域语义推理的感知导向潜在编码

计算机视觉与模式识别 2025-07-03 v1 图像与视频处理

摘要

近年来,压缩域语义推理主要依赖于针对均方误差(MSE)优化的学习图像编码模型。然而,MSE导向的优化往往导致潜在空间的语义丰富性有限,阻碍下游任务中有效的语义推理。此外,实现这些模型的高性能通常需要对整个视觉模型进行微调,这在大型模型上计算负担沉重。为此,我们引入感知导向潜在编码(POLC),一种为高性能压缩域语义推理而丰富潜在特征语义内容的方法。通过语义丰富的潜在空间,POLC只需一个即插即用适配器即可完成微调,显著降低了相较于以前MSE导向方法的参数数量。实验结果表明,POLC在与SOTA生成式图像编码方法相当的速率-感知性能方面取得优异成绩,并在视觉任务中显著提升性能,同时保持最小的微调开销。代码已公开于 https://github.com/NJUVISION/POLC。

关键词

引用

@article{arxiv.2507.01608,
  title  = {Perception-Oriented Latent Coding for High-Performance Compressed Domain Semantic Inference},
  author = {Xu Zhang and Ming Lu and Yan Chen and Zhan Ma},
  journal= {arXiv preprint arXiv:2507.01608},
  year   = {2025}
}

备注

International Conference on Multimedia and Expo (ICME), 2025