TVR:一种用于视频-字幕时刻检索的大规模数据集
计算机视觉与模式识别
2020-08-19 v2 计算与语言
信息检索
摘要
我们介绍了 TV show Retrieval (TVR),一个新的多模态检索数据集。TVR 要求系统同时理解视频及其关联的字幕(对话)文本,因而更为贴近现实。该数据集包含基于 6 部不同题材电视剧的 21.8K 个视频收集的 109K 条查询,每条查询都关联一个紧凑的时间窗口。查询还被标注了查询类型,以指示其更偏向视频、字幕还是二者皆有,从而可对数据集及构建于其上的方法进行深入分析。我们采用了严格的资格测试与标注后验证测试以确保所收集数据的质量。此外,我们提出了若干基线方法以及一种用于多模态时刻检索任务的新型跨模态时刻定位(XML)网络。所提出的 XML 模型采用后期融合设计,并结合新颖的卷积起止检测器(ConvSE),大幅超越基线方法且效率更高,为未来工作提供了有力的起点。我们还为 TVR 中每个标注时刻收集了额外描述,构成了一个含 262K 条字幕的新多模态描述数据集,名为 TV show Caption (TVC)。两个数据集均已公开。TVR: https://tvr.cs.unc.edu,TVC: https://tvr.cs.unc.edu/tvc.html。
引用
@article{arxiv.2001.09099,
title = {TVR: A Large-Scale Dataset for Video-Subtitle Moment Retrieval},
author = {Jie Lei and Licheng Yu and Tamara L. Berg and Mohit Bansal},
journal= {arXiv preprint arXiv:2001.09099},
year = {2020}
}
备注
ECCV 2020 (extended version, with TVC dataset+models; 35 pages)