中文

Much Ado About Time: Exhaustive Annotation of Temporal Data

人机交互 2016-10-07 v2 计算机视觉与模式识别

摘要

大规模标注数据集使人工智能系统能够学习并利用众包知识。许多众包技术已被开发用于收集图像标注。这些技术通常隐含地依赖于一个新输入图像的感知时间可忽略不计这一事实。相比之下,我们研究并确定了获取视频等时序数据的高质量多标签标注的最具成本效益的方法。观看即使只有 30 秒的短视频片段也需要众包工作者投入大量时间;因此,在一次观看后请求多个标注是一种重要的节省成本策略。但是,每个视频应该问多少问题?我们得出结论,最佳策略是在一个 HIT(人类智能任务)中尽可能多地提问(在我们的实验中,观看 30 秒视频片段后最多可问 52 个二元问题)。我们证明,虽然工作者可能无法正确回答所有问题,但成本效益分析仍然支持通过多次这种廉价但不完美的迭代达成共识,优于更复杂的替代方案。与每个视频只问一个问题的基线相比,我们的方法在相当的精确度下( ours 83.8% 对比基线 83.0%),实现了召回率 10% 的提升(ours 76.7% 对比基线 66.7%),且标注时间约为基线的一半(ours 3.8 分钟对比基线 7.1 分钟)。我们通过对 1,815 个视频中的 157 种人类活动收集多标签标注,展示了我们方法的有效性。

关键词

引用

@article{arxiv.1607.07429,
  title  = {Much Ado About Time: Exhaustive Annotation of Temporal Data},
  author = {Gunnar A. Sigurdsson and Olga Russakovsky and Ali Farhadi and Ivan Laptev and Abhinav Gupta},
  journal= {arXiv preprint arXiv:1607.07429},
  year   = {2016}
}

备注

HCOMP 2016 Camera Ready