中文

TGIF:一个关于动画GIF描述的新数据集与基准

计算机视觉与模式识别 2016-04-13 v2

摘要

随着动画GIF在社交媒体上的近期流行,需要以丰富元数据对其进行索引的方法。为了推进动画GIF理解的研究,我们收集了一个新数据集Tumblr GIF(TGIF),包含来自Tumblr的100K个动画GIF以及通过众包获得的120K条自然语言描述。本工作的动机是开发图像序列描述系统的测试床,其任务是为动画GIF或视频剪辑生成自然语言描述。为确保数据集高质量,我们开发了一系列新颖的质量控制方法,以验证众包工作者的自由形式文本输入。我们展示了数据集中视觉内容与自然语言描述之间存在明确的关联,这使其成为视觉内容字幕任务的理想基准。我们进行了广泛的统计分析,将我们的数据集与现有的图像和视频描述数据集进行比较。接下来,我们使用三种代表性技术:最近邻、统计机器翻译和循环神经网络,在动画GIF描述任务上提供了基线结果。最后,我们展示了从我们的动画GIF描述数据集微调的模型可有助于自动电影描述。

关键词

引用

@article{arxiv.1604.02748,
  title  = {TGIF: A New Dataset and Benchmark on Animated GIF Description},
  author = {Yuncheng Li and Yale Song and Liangliang Cao and Joel Tetreault and Larry Goldberg and Alejandro Jaimes and Jiebo Luo},
  journal= {arXiv preprint arXiv:1604.02748},
  year   = {2016}
}

备注

CVPR 2016 Camera Ready