一种用于动作检测的结构化模型
计算机视觉与模式识别
2019-06-06 v5
摘要
计算机视觉中基于学习的方法的一个主导范式是在大型数据集上训练通用模型,例如用于图像识别的 ResNet 或用于视频理解的 I3D,并让它们为手头的问题发现最优表示。虽然这显然是一种有吸引力的方法,但它并不适用于所有场景。我们主张动作检测就是这样一个具有挑战性的问题——需要训练的模型很大,且标注数据的获取成本高昂。为解决这一局限,我们提出将领域知识融入模型结构中,以简化优化。具体而言,我们在一个标准 I3D 网络上增加一个跟踪模块以聚合长期运动模式,并使用图卷积网络来推理参与者与物体之间的交互。在具有挑战性的 AVA 数据集上评估,所提方法相比 I3D 基线提升了 5.5% mAP,相比当前最优方法(SOTA)提升了 4.8% mAP。
引用
@article{arxiv.1812.03544,
title = {A Structured Model For Action Detection},
author = {Yubo Zhang and Pavel Tokmakov and Martial Hebert and Cordelia Schmid},
journal= {arXiv preprint arXiv:1812.03544},
year = {2019}
}