中文

基于视觉插值与帧选择引导的高效视频标注

计算机视觉与模式识别 2020-12-24 v1 人机交互

摘要

我们提出了一种用于边界框通用视频标注的统一框架。视频标注是一个长期存在的问题,因为它是一个繁琐且耗时的过程。我们解决了视频标注的两个重要挑战:(1)对人类标注员在所有帧子集上提供的边界框进行自动时间插值与外推;(2)自动选择需手动标注的帧。我们的贡献有两方面:首先,我们提出了一种兼具插值与外推能力的模型;其次,我们提出了一种引导机制,基于先前所做的标注顺序生成下一帧应标注什么的建议。我们在多个具有挑战性的数据集上通过仿真广泛评估了我们的方法,结果表明相较于线性插值,手动绘制边界框的数量减少了 60%,相较于现成跟踪器减少了 35%。此外,我们还展示了相较一种最先进的边界框视频标注方法 [25] 有 10% 的标注时间改进。最后,我们进行了人类标注实验并对结果提供了广泛分析,表明相较于常用的线性插值,我们的方法将实际测得的标注时间减少了 50%。

关键词

引用

@article{arxiv.2012.12554,
  title  = {Efficient video annotation with visual interpolation and frame selection guidance},
  author = {A. Kuznetsova and A. Talati and Y. Luo and K. Simmons and V. Ferrari},
  journal= {arXiv preprint arXiv:2012.12554},
  year   = {2020}
}

备注

accepted to WACV 2021