中文

更优的 ImageNet 分类器能更好地评估感知相似度吗?

计算机视觉与模式识别 2022-11-01 v3

摘要

在预训练深度特征空间中度量的图像间感知距离,在评估感知相似度方面已优于先前基于低级像素的指标。虽然 AlexNet 和 VGG 等较旧且精度较低的模型捕捉感知相似度的能力已为人所知,但对现代且更精确的模型的研究较少。在本文中,我们提出了一项大规模实证研究,以评估 ImageNet 分类器在感知相似度上的表现。首先,我们观察到 ResNets、EfficientNets 和 Vision Transformers 等现代网络的 ImageNet 准确率与感知分数之间存在反相关关系:即更好的分类器反而获得更差的感知分数。然后,我们通过改变深度、宽度、训练步数、权重衰减、标签平滑和 dropout,检验了 ImageNet 准确率/感知分数的关系。在达到一定程度之前,更高的准确率会提升感知分数,但我们在中高准确率区域发现了准确率与感知分数之间的帕累托前沿。我们使用多种合理的假设(如畸变不变性、空间频率敏感性和替代感知函数)进一步探索了这一关系。有趣的是,我们发现仅在 ImageNet 上训练且少于 5 个 epoch 的浅层 ResNets 和 ResNets,其涌现的感知分数与直接在人类监督感知判断上训练的先前最佳网络相匹配。本研究中模型的检查点可在 https://console.cloud.google.com/storage/browser/gresearch/perceptual_similarity 获取。

关键词

引用

@article{arxiv.2203.04946,
  title  = {Do better ImageNet classifiers assess perceptual similarity better?},
  author = {Manoj Kumar and Neil Houlsby and Nal Kalchbrenner and Ekin D. Cubuk},
  journal= {arXiv preprint arXiv:2203.04946},
  year   = {2022}
}

备注

TMLR 2022 (https://openreview.net/forum?id=qrGKGZZvH0)