中文

BreakingNews:通过图像与文本处理进行文章标注

计算机视觉与模式识别 2016-03-24 v1

摘要

基于近期的深度神经网络架构,当前处于计算机视觉与自然语言处理交叉领域的方法在自动字幕生成或图像检索等任务中取得了前所未有的突破。然而,这些学习方法大多依赖于与专门描述视觉内容的人工标注相关联的大型图像训练集。在本文中,我们提议更进一步,探索文本描述与图像松散相关的更复杂情况。我们专注于新闻文章这一特定领域,其中文本内容常常表达出隐含和模糊的关系,这些关系仅被暗示,而不能直接从图像中推断出来。我们引入了新的深度学习方法,用于处理来源检测、流行度预测、文章配图和文章地理定位。我们提出了一种自适应CNN架构,该架构为所有任务共享大部分结构,并适用于多任务学习和迁移学习。深度典型相关分析被用于文章配图,并针对地理定位提出了一种基于大圆距离的新损失函数。此外,我们发布了BreakingNews,这是一个包含约10万篇新闻文章的新数据集,包括图像、文本和标题,并丰富了异构元数据(如GPS坐标和流行度指标)。我们证明该数据集适用于探索所有上述问题,并为此提供了使用各种深度学习架构以及文本和视觉特征的不同表示的基线性能。我们报告了非常有前景的结果,并揭示了当前最先进技术在此类领域中的若干局限性,希望能有助于推动该领域的进展。

关键词

引用

@article{arxiv.1603.07141,
  title  = {BreakingNews: Article Annotation by Image and Text Processing},
  author = {Arnau Ramisa and Fei Yan and Francesc Moreno-Noguer and Krystian Mikolajczyk},
  journal= {arXiv preprint arXiv:1603.07141},
  year   = {2016}
}