中文

基于上下文感知CNN的人体头部检测

计算机视觉与模式识别 2015-11-26 v1 机器学习

摘要

人体检测是许多计算机视觉任务的关键问题。尽管人脸检测已趋于成熟,但在相机视角、人体姿态、光照条件和遮挡的完全变化下检测人仍然是一项艰巨挑战。本文聚焦于自然场景中的人体头部检测。从近期的局部 R-CNN 目标检测器出发,我们通过两类上下文线索对其扩展。首先,利用人与场景的关系,提出全局 CNN 模型,直接从整幅图像训练预测头部的位置与尺度。其次,显式建模物体间的成对关系,并使用结构化输出代理损失训练成对 CNN 模型。局部、全局和成对模型被组合进一个联合 CNN 框架。为训练与测试我们的完整模型,我们引入了一个大型数据集,包含 224,740 个电影帧中标注的 369,846 个人头。我们评估了该方法,并在三个数据集上针对若干近期基线展示了人体头部检测的提升。我们还展示了该模型在检测速度上的提升。

关键词

引用

@article{arxiv.1511.07917,
  title  = {Context-aware CNNs for person head detection},
  author = {Tuan-Hung Vu and Anton Osokin and Ivan Laptev},
  journal= {arXiv preprint arXiv:1511.07917},
  year   = {2015}
}

备注

To appear in International Conference on Computer Vision (ICCV), 2015