中文

MAD:一个源自电影音频描述的可扩展视频语言定位数据集

计算机视觉与模式识别 2022-03-29 v2 人工智能

摘要

近期视频语言研究日益增长的兴趣推动了大规模数据集的发展,使数据密集型的机器学习技术得以应用。相比之下,评估这些数据集对视频语言定位任务的适用性所作的努力有限。近期工作开始发现这些数据集存在显著局限,表明最先进的技术常常过拟合到隐藏的数据集偏差上。在本工作中,我们提出 MAD(Movie Audio Descriptions,电影音频描述),这是一个新颖的基准,它脱离了用文本标注扩充现有视频数据集的范式,专注于爬取并对齐主流电影的可用音频描述。MAD 包含超过 384,000 个自然语言句子,锚定在超过 1,200 小时的视频中,并且对当前已诊断出的视频语言定位数据集偏差表现出显著减少。MAD 的收集策略实现了一种新颖且更具挑战性的视频语言定位版本,其中短暂时序片段(通常长为数秒)必须准确地在时长可达三小时的多样化长视频中定位。我们已在 https://github.com/Soldelli/MAD 发布了 MAD 的数据与基线代码。

关键词

引用

@article{arxiv.2112.00431,
  title  = {MAD: A Scalable Dataset for Language Grounding in Videos from Movie Audio Descriptions},
  author = {Mattia Soldan and Alejandro Pardo and Juan León Alcázar and Fabian Caba Heilbron and Chen Zhao and Silvio Giancola and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2112.00431},
  year   = {2022}
}

备注

12 Pages, 6 Figures, 7 Tables