基于互联网照片集的地标识别:大规模评估
计算机视觉与模式识别
2015-06-12 v1
摘要
视觉地标识别系统的任务是在查询图像中识别被拍摄的建筑物或物体,并为用户提供相关信息。随着互联网照片集对全球地标建筑和物体的覆盖范围日益扩大,它们正被用作以全自动方式构建此类系统的来源。该过程通常包含三个步骤:按所描绘的物体对大量图像进行聚类;根据用户提供的标签确定物体名称;以及构建鲁棒、紧凑且高效的识别索引。然而,迄今为止,关于当前方法在大规模开放集挖掘和识别任务中表现如何的经验信息很少。此外,关于识别性能如何随地标物体类型的不同而变化,以及何处仍有改进潜力,也缺乏经验信息。本文旨在填补这些空白。利用来自巴黎的 50 万张图像数据集,我们分析了地标识别流程的每个组成部分,以回答以下问题:可以自动发现多少及何种类型的物体?如何最佳地利用生成的图像簇来识别查询中的物体?如何在内存中高效地表示物体以进行识别?语义信息提取的可靠性如何?最后:从查询到语义的整个流程中的限制因素是什么?我们评估了各个流程步骤中不同方法和参数的选择如何影响整体系统性能,并考察了它们对建筑物、绘画或雕塑等不同查询类别的影响。
引用
@article{arxiv.1409.5400,
title = {Visual Landmark Recognition from Internet Photo Collections: A Large-Scale Evaluation},
author = {Tobias Weyand and Bastian Leibe},
journal= {arXiv preprint arXiv:1409.5400},
year = {2015}
}