使用深度ConvNets表示的多视角产品图像检索
计算机视觉与模式识别
2017-05-02 v2 多媒体
摘要
多视角产品图像查询相比单视角查询能显著提升检索性能。本文中,我们研究了深度卷积神经网络(ConvNets)在多视角产品图像检索上的性能。首先,我们训练了一个类VGG网络来学习产品图像的深度ConvNets表示。然后,我们计算了数据库和查询图像的深度ConvNets表示,并使用几种早期和晚期融合方法执行了单视角查询和多视角查询。我们在公开可用的多视角物体图像数据集(MVOD 5K)上进行了大量实验,查询图像包括来自互联网的干净背景查询和来自手机的杂乱背景查询。我们将ConvNets的性能与经典的视觉词袋(BoWs)进行了比较。我们得出结论:(1)带有深度ConvNets表示的多视角查询明显优于单视角查询,(2)ConvNets比BoWs性能好得多且还有进一步改进空间,(3)为了在手机获取的杂乱产品图像查询上获得良好性能,需要在具有背景杂乱的不同图像数据集上对ConvNets进行预训练。
引用
@article{arxiv.1608.03462,
title = {Multi-View Product Image Search Using Deep ConvNets Representations},
author = {Muhammet Bastan and Ozgur Yilmaz},
journal= {arXiv preprint arXiv:1608.03462},
year = {2017}
}
备注
13 pages, 16 figures