中文

结合局部与全局图像描述符的场景识别

计算机视觉与模式识别 2017-02-23 v1 机器学习

摘要

目标识别是计算机视觉中的一个重要问题,具有多种应用。在这项工作中,我们构建了一个端到端的场景识别流程,包括特征提取、编码、池化和分类。我们的方法同时利用图像的全局特征描述符和局部特征描述符,为每幅图像形成一个混合特征描述符。我们利用与图像内关键点关联的 DAISY 特征作为局部特征描述符,并将整幅图像对应的方向梯度直方图(HOG)作为全局描述符。我们使用视觉词袋编码,并应用 Mini-Batch K-Means 算法来降低特征编码方案的复杂度。采用两级池化过程来组合每幅图像对应的 DAISY 和 HOG 特征。最后,我们在交叉验证设置下,使用带有多种核函数的多类 SVM 分类器进行实验,并在十五类场景数据集上列出了我们的结果。在将图像随机按 40%-60% 比例划分为训练集和测试集的情况下,我们模型的平均准确率为 76.4%。这项工作的主要目标是清晰地概述一个具有合理准确度的基本场景识别流程在 Python 中使用开源库的实际实现。所提出模型的完整实现可在我们的 GitHub 仓库中获得。

关键词

引用

@article{arxiv.1702.06850,
  title  = {Scene Recognition by Combining Local and Global Image Descriptors},
  author = {Jobin Wilson and Muhammad Arif},
  journal= {arXiv preprint arXiv:1702.06850},
  year   = {2017}
}

备注

A full implementation of our model is available at https://github.com/flytxtds/scene-recognition