中文

跨越边界:第一人称视频中物体交互的时间边界标注

计算机视觉与模式识别 2017-07-27 v2

摘要

物体交互时间边界(即起始和结束时间)的人工标注是识别、定位与检测算法的典型训练输入。针对三个公开的第一人称数据集,我们揭示了标注者内部及跨标注者与数据集之间在真值时间边界上的一致性差异。我们系统评估了当前最优方法在物体交互识别任务中对于标注时间边界变化的鲁棒性。当边界被跨越时,改进密集轨迹(Improved Dense Trajectories)与双流卷积神经网络(Two-Stream Convolutional Neural Network)均观察到最高达 10% 的性能下降。我们证明此类不一致源于对动作不同阶段的有限理解,并提议基于鲁比孔边界(Rubicon Boundaries,受同名认知模型启发)进行标注,以获得一致的物体交互时间边界。在一个公开数据集上的评估表明,当采用鲁比孔边界进行时间标注时,总体准确率提升 4%,且 55% 的类别准确率有所提高。

关键词

引用

@article{arxiv.1703.09026,
  title  = {Trespassing the Boundaries: Labeling Temporal Bounds for Object Interactions in Egocentric Video},
  author = {Davide Moltisanti and Michael Wray and Walterio Mayol-Cuevas and Dima Damen},
  journal= {arXiv preprint arXiv:1703.09026},
  year   = {2017}
}

备注

ICCV 2017