学习为计算机视觉任务调整图像尺寸
计算机视觉与模式识别
2021-08-19 v2 机器学习
摘要
尽管卷积神经网络近年来革新了计算机视觉的诸多方面,一个重要方面却出人意料地鲜受关注:图像尺寸对所训练任务准确率的影响。通常,为求高效,输入图像被缩放到较小的空间分辨率(如 224x224),且训练与推理均在此分辨率下进行。这种重缩放的实际机制一直被当作事后考虑:即大多数机器学习软件框架中常用双线性、双三次等现成图像缩放器。但这些缩放器会限制所训练网络的任务性能吗?答案是会。我们确实表明,典型的线性缩放器可被学习到的缩放器替代,从而大幅提升性能。重要的是,尽管经典缩放器通常使降采样图像具有更好的感知质量,我们提出的学习缩放器未必给出更好视觉质量,而是改善任务性能。我们的学习图像缩放器与基线视觉模型联合训练。这一基于 CNN 的学习缩放器产生机器友好的视觉处理,相较基线模型带来端任务度量的一致提升。具体而言,此处我们聚焦 ImageNet 数据集上的分类任务,并以四种不同模型实验学习适配各模型的缩放器。此外,我们表明所提缩放器亦有益于为其他视觉任务微调分类基线。为此,我们在 AVA 数据集上以三种不同基线实验开发图像质量评价(IQA)模型。
引用
@article{arxiv.2103.09950,
title = {Learning to Resize Images for Computer Vision Tasks},
author = {Hossein Talebi and Peyman Milanfar},
journal= {arXiv preprint arXiv:2103.09950},
year = {2021}
}
备注
Accepted to ICCV 2021