基于上下文感知CNN的人体头部检测
计算机视觉与模式识别
2015-11-26 v1 机器学习
摘要
人体检测是许多计算机视觉任务的关键问题。尽管人脸检测已趋于成熟,但在相机视角、人体姿态、光照条件和遮挡的完全变化下检测人仍然是一项艰巨挑战。本文聚焦于自然场景中的人体头部检测。从近期的局部 R-CNN 目标检测器出发,我们通过两类上下文线索对其扩展。首先,利用人与场景的关系,提出全局 CNN 模型,直接从整幅图像训练预测头部的位置与尺度。其次,显式建模物体间的成对关系,并使用结构化输出代理损失训练成对 CNN 模型。局部、全局和成对模型被组合进一个联合 CNN 框架。为训练与测试我们的完整模型,我们引入了一个大型数据集,包含 224,740 个电影帧中标注的 369,846 个人头。我们评估了该方法,并在三个数据集上针对若干近期基线展示了人体头部检测的提升。我们还展示了该模型在检测速度上的提升。
引用
@article{arxiv.1511.07917,
title = {Context-aware CNNs for person head detection},
author = {Tuan-Hung Vu and Anton Osokin and Ivan Laptev},
journal= {arXiv preprint arXiv:1511.07917},
year = {2015}
}
备注
To appear in International Conference on Computer Vision (ICCV), 2015