VISER:视觉自正则化
计算机视觉与模式识别
2018-02-08 v1 机器学习
摘要
在本工作中,我们提出使用大规模无标注图像集作为正则化数据来源,以学习鲁棒的视觉表征。给定一个由有标注数据集以监督方式训练的视觉模型,我们通过引入大量无标注数据扩充训练样本并训练一个半监督模型。我们证明,我们所提出的学习方法利用了丰富的无标注图像,提升了视觉识别性能,从而减轻了对大规模有标注数据集以学习鲁棒表征的依赖。为增加我们方法中学习鲁棒视觉模型所需的图像实例数量,每张有标注图像将其标签传播至其最近的无标注图像实例。这些检索到的无标注图像作为每张有标注图像的局部扰动以执行视觉自正则化(VISER)。为检索此类视觉自正则化子,我们在由全卷积神经网络倒数第二层定义的语义空间中计算余弦相似度。我们使用公开可用的 Yahoo Flickr Creative Commons 100M 数据集作为无标注图像集来源,并提出一种分布式近似最近邻算法以在该规模下使检索可行。利用有标注实例及其正则化样本,我们表明在对象于情境中出现的 MS COCO 与 Visual Genome 数据集上,我们显著改进了对象分类与定位性能。
引用
@article{arxiv.1802.02568,
title = {VISER: Visual Self-Regularization},
author = {Hamid Izadinia and Pierre Garrigues},
journal= {arXiv preprint arXiv:1802.02568},
year = {2018}
}