中文

面向机器的图像编码:一种端到端学习方法

计算机视觉与模式识别 2021-08-31 v2 机器学习 图像与视频处理

摘要

近年来,基于深度学习的计算机视觉系统以越来越快的速度应用于图像,这些图像往往仅被此类系统所消费。鉴于每日生成图像数量的急剧增长,一个问题随之而来:针对机器消费的图像编解码器相比针对人类消费的最先进编解码器,性能究竟能好多少?在本文中,我们提出了一种基于神经网络(NN)且端到端学习的面向机器的图像编解码器。特别地,我们提出了一组训练策略,以解决平衡竞争性损失函数(如计算机视觉任务损失、图像失真损失和码率损失)这一棘手问题。我们的实验结果表明,基于 NN 的编解码器在目标检测和实例分割任务上优于最先进的 Versatile Video Coding (VVC) 标准,分别取得 -37.87% 和 -32.90% 的 BD-rate 增益,并且因其紧凑尺寸而具有较快速度。据我们所知,这是首个端到端学习的面向机器的图像编解码器。

关键词

引用

@article{arxiv.2108.09993,
  title  = {Image coding for machines: an end-to-end learned approach},
  author = {Nam Le and Honglei Zhang and Francesco Cricri and Ramin Ghaznavi-Youvalari and Esa Rahtu},
  journal= {arXiv preprint arXiv:2108.09993},
  year   = {2021}
}

备注

Fixed a couple of mistakes since the version accepted in IEEE ICASSP2021