中文

利用感知相似性度量学习生成图像

机器学习 2017-01-25 v3 计算机视觉与模式识别

摘要

深度网络正日益被应用于涉及图像合成的问题,例如从文本描述生成图像以及从紧凑表示重建输入图像。图像合成网络的有监督训练通常使用逐像素损失(PL)来指示生成图像与对应目标图像之间的失配。我们转而提出使用一种更契合人类图像质量感知判断的损失函数:多尺度结构相似性分数(MS-SSIM)。由于MS-SSIM可微,它易被纳入梯度下降学习。我们比较了在训练确定性与随机自编码器时使用MS-SSIM与PL损失的后果。对于三种不同架构,我们收集了人类对图像重建质量的判断。对于两种不同的PL度量(1\ell_12\ell_2距离),观察者可靠地偏好由MS-SSIM优化模型合成的图像甚于由PL优化模型合成的图像。我们还探索了训练目标对图像编码的影响,并分析了感知优化表示在图像分类上产生更好性能的条件。最后,我们展示了感知优化网络在超分辨率成像中的优越性。正如计算机视觉通过采用模仿哺乳动物视觉系统结构的卷积架构而取得进展,我们认为通过采用与人类感知特征良好对齐的训练目标,可在图像建模上取得显著的额外进展。

关键词

引用

@article{arxiv.1511.06409,
  title  = {Learning to Generate Images with Perceptual Similarity Metrics},
  author = {Jake Snell and Karl Ridgeway and Renjie Liao and Brett D. Roads and Michael C. Mozer and Richard S. Zemel},
  journal= {arXiv preprint arXiv:1511.06409},
  year   = {2017}
}