中文

利用潜空间掩蔽提升面向机器的神经图像压缩

图像与视频处理 2024-10-28 v2

摘要

如今,许多图像编码场景的最终用户并非人类,而是对解码图像执行计算机视觉任务的机器。因此,主要目标不是保持视觉质量,而是在给定码率下维持机器的任务精度。由于深度神经网络取得了树立基准的巨幅进展,解码端的分析任务大多采用神经网络求解。此外,神经网络近来也进入了图像压缩领域。这两方面的发展使得以分析网络作为信息汇的神经压缩网络端到端训练成为可能。因此,我们首先推出这样一种采用任务特定损失的训练,以增强神经压缩网络的编码性能。相较于标准 VVC,在未经压缩的 Cityscapes 数据集上以 Mask R-CNN 作为分析网络时,该方法节省了 41.4% 的码率。作为主要贡献,我们提出 LSMnet,一种与编码器网络并行运行并掩蔽掉潜空间中分析网络大概不需要的元素的网络。相较于以任务损失优化的基础神经压缩网络,该方法额外节省了 27.3% 的码率。此外,我们首次在机器到机器通信背景下于训练损失中利用基于特征的失真,从而无需标注数据即可训练。我们在 Cityscapes 数据集上提供了包括使用不同分析网络的跨评估在内的广泛分析,并给出了示例性视觉结果。推理代码与预训练模型发布于 https://github.com/FAU-LMS/NCN_for_M2M。

关键词

引用

@article{arxiv.2112.08168,
  title  = {Boosting Neural Image Compression for Machines Using Latent Space Masking},
  author = {Kristian Fischer and Fabian Brand and André Kaup},
  journal= {arXiv preprint arXiv:2112.08168},
  year   = {2024}
}

备注

12 pages, 9 figures, 3 tables; This work has been accepted for IEEE T-CSVT special issue "Learned Visual Data Compression for both Human and Machine"