Rekall:使用时空标签组合指定视频事件
数据库
2019-10-09 v1 计算与语言
计算机视觉与模式识别
信息检索
摘要
许多真实世界的视频分析应用需要识别视频中特定领域的事件,例如电视新闻广播中的采访与广告,或电影中的动作片段。遗憾的是,用于检测视频中所有感兴趣事件的预训练模型可能并不存在,而从零开始训练新模型可能成本高昂且劳动密集。在本文中,我们以更传统的方式探索在视频中指定新事件的效用:通过编写组合现有预训练模型输出的查询。为编写这些查询,我们开发了Rekall,一个为组合式视频事件指定提供数据模型与编程模型的库。Rekall将来自不同来源(目标检测器、转录文本等)的视频标注表示为与视频中连续时空体相关联的时空标签,并提供将这些标签组合为建模新视频事件的查询的算子。我们展示了Rekall在分析来自有线电视新闻广播、电影、静态相机车载视频流和商业自动驾驶日志的视频中的用途。在这些工作中,领域专家能够快速(几小时到一天内)编写查询,从而实现新事件的准确检测(与学习方法相当,且在某些情况下远比学习方法准确),并快速检索视频片段以用于人工介入任务,例如视频内容策展与训练数据策展。最后,在一项用户研究中,Rekall的新手用户仅给定一个小时的查询开发时间便能够编写查询以检索视频中的新事件。
引用
@article{arxiv.1910.02993,
title = {Rekall: Specifying Video Events using Compositions of Spatiotemporal Labels},
author = {Daniel Y. Fu and Will Crichton and James Hong and Xinwei Yao and Haotian Zhang and Anh Truong and Avanika Narayan and Maneesh Agrawala and Christopher Ré and Kayvon Fatahalian},
journal= {arXiv preprint arXiv:1910.02993},
year = {2019}
}