GIF 自动字幕:用于视觉-语言预训练的大规模视频-句子数据集
计算机视觉与模式识别
2020-07-07 v1 计算与语言
摘要
在本工作中,我们提出 Auto-captions on GIF,这是一个用于通用视频理解的新大规模预训练数据集。所有视频-句子对均通过自动提取并过滤来自数十亿网页的视频字幕标注而创建。Auto-captions on GIF 数据集可用于预训练通用特征表示或编码器-解码器结构以用于视频字幕生成,以及其他下游任务(例如,视频中句子定位、视频问答等)。我们给出了 Auto-captions on GIF 数据集与现有视频-句子数据集的详细对比分析。我们还评估了基于 Transformer 的编码器-解码器结构用于视觉-语言预训练,该结构进一步适配于视频字幕生成下游任务,并在 MSR-VTT 上产生了引人注目的泛化能力。数据集可在 \url{http://www.auto-video-captions.top/2020/dataset} 获取。
引用
@article{arxiv.2007.02375,
title = {Auto-captions on GIF: A Large-scale Video-sentence Dataset for Vision-language Pre-training},
author = {Yingwei Pan and Yehao Li and Jianjie Luo and Jun Xu and Ting Yao and Tao Mei},
journal= {arXiv preprint arXiv:2007.02375},
year = {2020}
}
备注
The Auto-captions on GIF dataset is available at \url{http://www.auto-video-captions.top/2020/dataset}