中文

基于视觉词袋优化与缩减的图像分类

计算机视觉与模式识别 2017-07-04 v1

摘要

本文提出了一种新的视觉词袋(BOW)优化与缩减框架,以克服广泛用于图像分类的传统视觉 BOW 模型的缺陷。尽管传统视觉 BOW 模型在文献中影响深远,但它存在两个明显的缺点。首先,出于效率考虑,视觉词典通常直接通过对从局部关键点提取的低层视觉特征向量进行聚类来构建,而未考虑图像的高层语义。也就是说,视觉 BOW 模型仍受限于语义鸿沟,因此在更具挑战性的任务(例如社交图像分类)中可能导致显著的性能下降。其次,为了在相对较大的图像数据集上获得更好的性能,通常会生成数千个视觉词。由于词汇量如此庞大,后续的图像分类可能需要耗费大量时间。为了克服第一个缺点,我们开发了一种基于图的方法,利用社交图像的标签(易于获取但含有噪声)对视觉 BOW 进行优化。更重要的是,为了实现高效的图像分类,我们通过语义谱聚类将优化后的视觉 BOW 模型进一步缩减为更小的规模。大量的实验结果表明,所提出的视觉 BOW 优化与缩减框架具有令人期待的性能。

关键词

引用

@article{arxiv.1501.04292,
  title  = {Image classification by visual bag-of-words refinement and reduction},
  author = {Zhiwu Lu and Liwei Wang and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:1501.04292},
  year   = {2017}
}