通过特征预测损失在无重构情况下预训练图像编码器
计算机视觉与模式识别
2021-05-19 v2 机器学习
摘要
本工作研究了基于自编码器的图像编码器预训练中计算损失的三种方法:常用的重构损失、较新引入的深度感知相似性损失,以及此处提出的特征预测损失;后者被证明是最有效的选择。深度学习任务的标准自编码器预训练是通过比较输入图像与重构图像来完成的。近期工作表明,基于图像自编码器所生成嵌入的预测可通过感知损失(即在解码步骤后添加损失网络)训练得以改进。迄今为止,用损失网络训练的自编码器都使用损失网络对原始图像与重构图像进行显式比较。然而,给定这样的损失网络,我们表明无需执行解码整幅图像这一耗时任务。相反,我们提议解码损失网络的特征,故名“特征预测损失”。为评估该方法,我们在三个标准公开数据集(LunarLander-v2、STL-10 和 SVHN)上进行实验,并比较六种训练图像编码器的不同流程(像素级、感知相似性、特征预测损失;结合图像与特征编码/解码的两种变体)。基于嵌入的预测结果显示,用特征预测损失训练的编码器优于或用其他两种损失训练的编码器相当。此外,相较于其他损失,使用特征预测损失训练编码器显著更快。本工作所用方法实现已在线提供:https://github.com/guspih/Perceptual-Autoencoders
引用
@article{arxiv.2003.07441,
title = {Pretraining Image Encoders without Reconstruction via Feature Prediction Loss},
author = {Gustav Grund Pihlgren and Fredrik Sandin and Marcus Liwicki},
journal= {arXiv preprint arXiv:2003.07441},
year = {2021}
}