中文

深度特征作为感知度量的不合理有效性

计算机视觉与模式识别 2018-04-12 v2 图形学

摘要

尽管人类近乎不费力便能快速评估两幅图像的感知相似度,其底层过程却被认为相当复杂。尽管如此,当今使用最广泛的感知度量,如 PSNR 与 SSIM,均为简单、浅层的函数,未能考虑人类感知的诸多细微差别。近来,深度学习界发现,在 ImageNet 分类上训练的 VGG 网络的特征作为图像合成的训练损失异常有用。但这些所谓“感知损失”的感知性如何?其成功的关键要素是什么?为回答这些问题,我们引入了一个新的人类感知相似度判断数据集。我们系统评估了不同架构与任务下的深度特征,并与经典度量比较。我们发现深度特征在我们的数据集上以大幅优势超越此前所有度量。更令人惊讶的是,该结果不限于 ImageNet 训练的 VGG 特征,而是适用于不同深度架构与监督程度(有监督、自监督甚至无监督)。我们的结果表明,感知相似度是深度视觉表示间共享的涌现属性。

关键词

引用

@article{arxiv.1801.03924,
  title  = {The Unreasonable Effectiveness of Deep Features as a Perceptual Metric},
  author = {Richard Zhang and Phillip Isola and Alexei A. Efros and Eli Shechtman and Oliver Wang},
  journal= {arXiv preprint arXiv:1801.03924},
  year   = {2018}
}

备注

Accepted to CVPR 2018; Code and data available at https://www.github.com/richzhang/PerceptualSimilarity