通过体育运动构建可扩展的视频理解基准
计算机视觉与模式识别
2023-03-28 v3
摘要
现有的用于评估长视频理解的基准在两个关键方面存在不足,要么在规模上,要么在标注质量上。这些局限性源于为长视频收集密集标注的困难,这通常需要手动标注每一帧。在这项工作中,我们引入了一种自动化的标注与视频流对齐流水线(缩写为 ASAP)。我们通过将四种不同体育运动的未标注视频与相应的免费密集网络标注(即解说词)进行对齐,展示了 ASAP 的通用性。然后,我们利用 ASAP 的可扩展性创建了 LCric,这是一个大规模长视频理解基准,包含超过 1000 小时的密集标注长板球视频(平均样本长度约 50 分钟),其收集几乎零标注成本。我们通过大量组合多选和回归查询,在 LCric 上对最先进的视频理解模型进行了基准测试和分析。我们建立了一个人类基线,表明还有巨大的空间供新研究探索。我们的人类研究表明,ASAP 能够以高保真度、高精度和高速度对齐视频和标注。该数据集以及 ASAP 和基线的代码可在此处获取:https://asap-benchmark.github.io/。
引用
@article{arxiv.2301.06866,
title = {Building Scalable Video Understanding Benchmarks through Sports},
author = {Aniket Agarwal and Alex Zhang and Karthik Narasimhan and Igor Gilitschenski and Vishvak Murahari and Yash Kant},
journal= {arXiv preprint arXiv:2301.06866},
year = {2023}
}