面向人类与机器的显式残差可扩展图像编码
机器学习
2025-06-25 v1
摘要
可扩展图像压缩是一种逐步重构图像多个版本的技术,以满足不同需求。近年来,图像消费不仅限于人类,也越来越多地被图像识别模型所消费。这一转变引发了对服务机器人类视觉(ICMH)的可扩展图像压缩方法的关注。许多现有模型采用神经网络基础编解码器,即所谓的学习图像压缩,已通过精心设计损失函数在该领域取得了显著进展。然而,在某些情况下,这些模型过于依赖学习能力,其架构设计不够充分。本文通过集成一种显式残差压缩机制(此机制常见于分辨率可扩展编码方法中,如 JPEG2000),增强了 ICMH 框架的编码效率和可解释性。具体地,我们提出两种互补方法:基于特征残差的可扩展编码(FR-ICMH)和基于像素残差的可扩展编码(PR-ICMH)。这些提议方法适用于各种机器视觉任务。此外,它们提供了在编码复杂度与压缩性能之间的灵活选择,使其能够适应多样化的应用需求。实验结果表明,我们的提议方法有效,PR-ICMH 相较于前期工作实现了最高达 29.57% 的 BD-rate 节省。
引用
@article{arxiv.2506.19296,
title = {The Effect of Depth on the Expressivity of Deep Linear State-Space Models},
author = {Zeyu Bao and Penghao Yu and Haotian Jiang and Qianxiao Li},
journal= {arXiv preprint arXiv:2506.19296},
year = {2025}
}