中文

利用稀疏和不完整标签发现视觉概念结构

计算机视觉与模式识别 2017-05-31 v1

摘要

自动发现带标签视觉数据(例如网络视频和图像)的语义结构对于视觉数据分析和解释至关重要,它使机器智能能够有效处理快速增长的多媒体数据量。然而,由于需要联合学习异构视觉数据和标签数据之间的潜在关联,这并非易事。固有的稀疏和不完整标签使得该任务更具挑战性。在这项工作中,我们基于一种新颖的分层多标签随机森林模型,开发了一种对固有视觉数据概念结构进行建模的方法,该模型能够关联结构化的视觉信息和标签信息,从而更准确地解释视觉语义,例如揭示具有相似高层概念的、有意义的视觉分组,并为单个视觉数据样本恢复缺失的标签。具体来说,除了对视觉和标签交互进行建模外,我们的模型还利用了不同语义抽象度的分层结构化标签以及多重标签统计相关性。因此,我们的模型能够在文本标签和视觉特征之间发现更准确的语义相关性,并最终即使在标签高度稀疏和不完整的情况下也能提供良好的视觉语义解释。我们在基准视频(即TRECVID MED 2011)和图像(即NUS-WIDE)数据集上,通过视觉数据聚类和缺失标签补全这两个基本应用,展示了我们所提出方法的优势。

关键词

引用

@article{arxiv.1705.10659,
  title  = {Discovering Visual Concept Structure with Sparse and Incomplete Tags},
  author = {Jingya Wang and Xiatian Zhu and Shaogang Gong},
  journal= {arXiv preprint arXiv:1705.10659},
  year   = {2017}
}

备注

Artificial Intelligence journal 2017