用于图像实例检索的群不变深度表示
计算机视觉与模式识别
2016-01-14 v2 信息检索
摘要
大多数图像实例检索流水线基于查询图像与数据库图像之间被称为全局图像描述子的向量比较。由于其在大规模图像分类中的成功,从卷积神经网络(CNN)提取的表示正迅速取代Fisher向量(FVs)成为图像实例检索的最先进全局描述子。虽然基于CNN的描述子通常以较低比特率表现出良好的检索性能,但它们呈现出若干缺点,包括相较于基于兴趣点的FV对应物缺乏对常见目标变换(如旋转)的鲁棒性。在本文中,我们提出一种从CNN计算不变全局描述子的方法。我们的方法实现了最近提出的关于感觉皮层建模为前馈神经网络的不变性数学理论。所得的全局描述子可对任意多个变换群保持不变,同时保留良好的判别性。基于使用几个公开可用数据集的彻底经验评估,我们表明每次并入新型不变性时,我们的方法能够显著且持续地改善检索结果。我们还表明我们具有少量参数的方法不易过拟合:改进在不同不变性相关属性的数据集间很好地泛化。最后,我们表明我们的描述子能够在相似比特范围内与其他最先进紧凑描述子有利比较,在某些数据集上超过了文献中报道的最高检索结果。一个专门的降维步骤——量化或哈希——可能能够进一步提升描述子的竞争力。
引用
@article{arxiv.1601.02093,
title = {Group Invariant Deep Representations for Image Instance Retrieval},
author = {Olivier Morère and Antoine Veillard and Jie Lin and Julie Petta and Vijay Chandrasekhar and Tomaso Poggio},
journal= {arXiv preprint arXiv:1601.02093},
year = {2016}
}