中文

基于全局一致性多特征共享学习的视觉理解

计算机视觉与模式识别 2016-11-15 v2 机器学习

摘要

图像/视频数据通常用多个视觉特征表示。用于建立属性的多源信息融合已被广泛认可。多特征视觉识别最近在多媒体应用中受到很多关注。本文通过新提出的基于 l_2 范数的多特征共享学习框架研究视觉理解,该框架可以利用有标签的多特征数据同时学习一个全局标签矩阵和多个子分类器。此外,提出了由拉普拉斯图和赫斯图组成的组图流形正则化器,以更好地保留每个特征的流形结构,从而通过具有全局标签一致性的半监督学习大幅改善标签预测能力。为方便起见,我们称所提出的方法为全局标签一致分类器(Global-Label-Consistent Classifier, GLCC)。所提方法的优点包括:1) 在学习中利用了每个特征的流形结构信息,由于全局标签一致性从而实现了更忠实的分类;2) 构建了基于拉普拉斯和赫斯正则化的组图流形正则化器;3) 由于凸子问题,引入了高效的替代优化方法作为快速求解器。在几个用于多媒体理解的基准视觉数据集上的实验,例如 17 类 Oxford Flower 数据集、具有挑战性的 101 类 Caltech 数据集、YouTube & Consumer Videos 数据集和大规模 NUS-WIDE 数据集,表明所提方法与最先进算法相比具有优势。在深度卷积激活特征上的大量实验也显示了所提方法的有效性。代码可在 http://www.escience.cn/people/lei/index.html 获取。

关键词

引用

@article{arxiv.1505.05233,
  title  = {Visual Understanding via Multi-Feature Shared Learning with Global Consistency},
  author = {Lei Zhang and David Zhang},
  journal= {arXiv preprint arXiv:1505.05233},
  year   = {2016}
}

备注

13 pages,6 figures, this paper is accepted for publication in IEEE Transactions on Multimedia