中文

QuerYD:一个带有高质量文本与音频解说的视频数据集

计算机视觉与模式识别 2021-02-18 v2

摘要

我们介绍 QuerYD,一个用于视频检索与事件定位的新大规模数据集。我们数据集的一个独特特征是每个视频提供两条音轨:原始音频,以及对视觉内容的高质量语音描述。该数据集基于 YouDescribe,这是一个通过为现有 YouTube 视频附加语音解说以协助视障人士的志愿者项目。这一不断增长的视频集合包含高度详细、时间对齐的音频与文本标注。其内容描述比对话更相关,且比先前描述尝试更详细,后者可观察到包含许多肤浅或无信息量的描述。为展示 QuerYD 数据集的效用,我们表明它可用于训练和评测用于检索与事件定位的强模型。数据、代码与模型已公开可用,我们希望 QuerYD 能启发更多基于书面与口语自然语言的视频理解研究。

关键词

引用

@article{arxiv.2011.11071,
  title  = {QuerYD: A video dataset with high-quality text and audio narrations},
  author = {Andreea-Maria Oncescu and João F. Henriques and Yang Liu and Andrew Zisserman and Samuel Albanie},
  journal= {arXiv preprint arXiv:2011.11071},
  year   = {2021}
}

备注

5 pages, 4 figures, accepted at ICASSP 2021