中文

基于图像-描述对的事件特定多模态模式挖掘

计算机视觉与模式识别 2016-01-06 v2

摘要

在本文中,我们描述了一种新颖的框架与算法,用于从新闻事件生成的大规模弱监督图像-描述对语料中发现图像块模式。当前的模式挖掘技术试图寻找具有代表性和判别性的模式,我们规定所发现的模式还必须能被人类识别,且最好具有有意义的名称。我们提出了一种新的多模态模式挖掘方法,利用常伴随新闻图像的描述性题注来学习具有语义意义的图像块模式。随后,利用从每个模式关联的图像描述中挖掘的词汇对这些多模态模式进行命名。我们提供了一种新颖的评估框架,表明我们的模式比最先进的纯视觉流水线在语义有意义性上高出26.2%,并且能够在无直接监督的情况下以54.5%的准确率为发现的图像块提供标签。我们的方法还发现了超出ImageNet等现有图像数据集所涵盖的命名模式。据我们所知,这是首个被开发用于自动挖掘针对高层新闻事件具有强语义意义的图像块模式,并基于该标准对这些模式进行评估的算法。

关键词

引用

@article{arxiv.1601.00022,
  title  = {Event Specific Multimodal Pattern Mining with Image-Caption Pairs},
  author = {Hongzhi Li and Joseph G. Ellis and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:1601.00022},
  year   = {2016}
}