中文

一个更好的 AVA 基线

计算机视觉与模式识别 2018-07-27 v1

摘要

我们为 AVA 数据集上的动作定位引入了一个简单基线。该模型构建于 Faster R-CNN 边界框检测框架之上,适配于纯时空特征——在我们的例子中仅由在 Kinetics 上预训练的 I3D 模型产生。该模型在 AVA v2.1 验证集上取得 21.9% 的平均 AP,高于原 AVA 论文中使用的最佳 RGB 时空模型(在 Kinetics 和 ImageNet 上预训练)的 14.5%,也高于使用在 ImageNet 上预训练的 ResNet101 图像特征提取器的公开可用基线的 11.3%。我们的最终模型在验证/测试集上取得 22.8%/21.9% 的 mAP,并优于 CVPR 2018 所有提交至 AVA 挑战赛的方案。

关键词

引用

@article{arxiv.1807.10066,
  title  = {A Better Baseline for AVA},
  author = {Rohit Girdhar and João Carreira and Carl Doersch and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1807.10066},
  year   = {2018}
}

备注

ActivityNet Workshop (AVA Challenge), CVPR 2018