中文

Twitter100k:用于弱监督跨媒体检索的真实世界数据集

计算机视觉与模式识别 2017-03-21 v1

摘要

本文贡献了一个用于弱监督跨媒体检索的新的大规模数据集,名为Twitter100k。当前数据集,如Wikipedia、NUS Wide和Flickr30k,有两个主要局限。首先,这些数据集缺乏内容多样性,即仅覆盖一些预定义类别。其次,这些数据集中的文本以组织良好的语言书写,导致与真实应用不一致。为克服这些缺陷,所提出的Twitter100k数据集有两个特点:1)它有从Twitter随机爬取的100,000个图像-文本对,因此图像类别无约束;2)Twitter100k中的文本由用户以非正式语言书写。由于强监督方法利用了实践中可能缺失的类别标签,本文关注跨媒体检索的弱监督学习,其中训练期间仅利用文本-图像对。我们在Wikipedia、Flickr30k和Twitter100k上广泛基准测试了四种子空间学习方法和Correspondence AutoEncoder的三种变体,以及各种文本特征。提供了新颖见解。作为一个次要贡献,受Twitter100k特性启发,我们提出了一种基于OCR的跨媒体检索方法。实验中,我们展示了所提出的基于OCR的方法提升了基线性能。

关键词

引用

@article{arxiv.1703.06618,
  title  = {Twitter100k: A Real-world Dataset for Weakly Supervised Cross-Media Retrieval},
  author = {Yuting Hu and Liang Zheng and Yi Yang and Yongfeng Huang},
  journal= {arXiv preprint arXiv:1703.06618},
  year   = {2017}
}