无需人工标注微调CNN图像检索
计算机视觉与模式识别
2018-07-12 v2
摘要
基于卷积神经网络(CNN)激活的图像描述子因其判别力、表示的紧凑性和检索效率已成为图像检索中的主导方法。CNN的训练,无论是从头训练还是微调,都需要大量标注数据,而高质量的标注往往至关重要。在本工作中,我们提出以完全自动化的方式在大规模无序图像集合上微调CNN用于图像检索。由最先进的检索和运动恢复结构方法重建的3D模型指导训练数据的选择。我们表明,利用3D模型中可用的几何和相机位姿所选择的难正例和难负例提升了特定目标检索的性能。从相同训练数据判别式学习的CNN描述子白化优于常用的PCA白化。我们提出一种新颖的可训练广义均值(GeM)池化层,它推广了最大和平均池化,并表明其提升了检索性能。将所提方法应用于VGG网络在标准基准Oxford Buildings、Paris和Holidays数据集上实现了最先进的性能。
引用
@article{arxiv.1711.02512,
title = {Fine-tuning CNN Image Retrieval with No Human Annotation},
author = {Filip Radenović and Giorgos Tolias and Ondřej Chum},
journal= {arXiv preprint arXiv:1711.02512},
year = {2018}
}
备注
TPAMI 2018. arXiv admin note: substantial text overlap with arXiv:1604.02426