中文

视觉学习中的特征与区域选择

计算机视觉与模式识别 2016-01-20 v2 机器学习

摘要

物体分类和行为识别等视觉学习问题通常采用流行的词袋 (BoW) 模型的扩展方法来解决。尽管该模型取得了巨大成功,但尚不清楚 BoW 模型正在学习哪些视觉特征:图像或视频中的哪些区域被用于区分不同类别?哪些是最具判别力的视觉词?回答这些问题对于理解现有的 BoW 模型以及启发更好的视觉识别模型至关重要。为回答这些问题,本文提出了一种在视觉 BoW 模型中进行特征选择和区域选择的方法。这使得能够对视觉学习中重要的特征和区域进行中间可视化。其主要思想是为特征或区域分配潜在权重,并将这些潜在变量与分类器(例如支持向量机)的参数联合优化。我们的方法有四个主要优点:(1) 我们的方法适用于非线性加性核,如流行的 χ2\chi^2 核和交集核;(2) 我们的方法能够以统一的方式处理图像中的区域和视频中的时空区域;(3) 特征选择问题是凸的,且两个问题均可使用可扩展的约化梯度法求解;(4) 我们指出了与多核学习和多示例学习方法的紧密联系。在 PASCAL VOC 2007、MSR Action Dataset II 和 YouTube 上的实验结果证实了我们方法的优势。

关键词

引用

@article{arxiv.1407.5245,
  title  = {Feature and Region Selection for Visual Learning},
  author = {Ji Zhao and Liantao Wang and Ricardo Cabral and Fernando De la Torre},
  journal= {arXiv preprint arXiv:1407.5245},
  year   = {2016}
}