利用位置上下文改进图像分类
计算机视觉与模式识别
2015-05-18 v1
摘要
随着具有 GPS 功能的手机和相机的广泛普及,如今上传到互联网的图像通常带有相关的 GPS 坐标。除了试图从视觉特征预测 GPS 坐标的研究外,这也开启了以 GPS 坐标可用为条件的问题。在这项工作中,我们解决了利用位置上下文进行图像分类的问题,即在训练和测试阶段都给定图像的 GPS 坐标。我们探索了从不同 GPS 坐标编码和提取特征的方法,并展示了如何将这些特征自然地整合到卷积神经网络 (CNN) 中,CNN 是当前大多数图像分类和识别问题的最优方法。我们还展示了如何在 CNN 框架内同时学习我们部分特征的最优池化半径。为了评估我们的模型并推动该领域的研究,我们确定了一组位置敏感概念,并使用了带有这些概念的、具有 GPS 坐标的 Yahoo Flickr Creative Commons 100M 数据集的一个子集进行标注,该子集已公开可用。通过利用位置上下文,我们能够使平均精度均值提升近 7%。
引用
@article{arxiv.1505.03873,
title = {Improving Image Classification with Location Context},
author = {Kevin Tang and Manohar Paluri and Li Fei-Fei and Rob Fergus and Lubomir Bourdev},
journal= {arXiv preprint arXiv:1505.03873},
year = {2015}
}