中文

ACD:从图像-句子语料库中发现动作概念

计算机视觉与模式识别 2016-04-19 v1

摘要

静态图像中的动作分类是计算机视觉中的一个重要任务。它是具有挑战性的,因为动作的外观可能根据其上下文(例如相关物体)而变化。手动标注上下文信息将耗时且难以扩展。为应对这一挑战,我们提出了一种方法,从弱监督的图像-句子语料库中自动发现和聚类动作概念,并学习它们的分类器。它通过从句子中提取动宾对并借助关联图像验证其视觉性来获得候选动作概念。然后使用深度卷积网络的图像嵌入和word2vec的文本嵌入的多模态表示对候选动作概念进行聚类。从Flickr 30k数据集中学习了超过一百个人类动作概念分类器,无需额外人力,并获得了有前景的分类结果。我们进一步应用AdaBoost算法,在给定动作查询时自动选择并组合相关动作概念。在PASCAL VOC 2012动作分类基准上展示了有前景的结果,该基准与Flickr30k零重叠。

关键词

引用

@article{arxiv.1604.04784,
  title  = {ACD: Action Concept Discovery from Image-Sentence Corpora},
  author = {Jiyang Gao and Chen Sun and Ram Nevatia},
  journal= {arXiv preprint arXiv:1604.04784},
  year   = {2016}
}

备注

8 pages, accepted by ICMR 2016