使用上下文金字塔 CNN 生成高质量人群密度图
计算机视觉与模式识别
2017-08-04 v1
摘要
我们提出了一种称为 Contextual Pyramid CNN (CP-CNN) 的新方法,通过显式地结合人群图像的全局和局部上下文信息来生成高质量的人群密度和计数估计。所提出的 CP-CNN 由四个模块组成:全局上下文估计器 (GCE)、局部上下文估计器 (LCE)、密度图估计器 (DME) 和 Fusion-CNN (F-CNN)。GCE 是一个基于 VGG-16 的 CNN,用于编码全局上下文,并被训练以将输入图像分类为不同的密度等级;而 LCE 是另一个编码局部上下文信息的 CNN,被训练以对输入图像进行不同密度等级的分块分类。DME 是一个基于多列架构的 CNN,旨在从输入图像生成高维特征图,这些特征图使用 F-CNN 与 GCE 和 LCE 估计的上下文信息进行融合。为了生成高分辨率且高质量的密度图,F-CNN 使用了一组卷积层和分数步幅卷积层,并使用对抗损失和像素级欧几里得损失的组合,以端到端的方式与 DME 一起进行训练。在极具挑战性的数据集上的大量实验表明,所提出的方法相较于 SOTA 方法取得了显著提升。
引用
@article{arxiv.1708.00953,
title = {Generating High-Quality Crowd Density Maps using Contextual Pyramid CNNs},
author = {Vishwanath A. Sindagi and Vishal M. Patel},
journal= {arXiv preprint arXiv:1708.00953},
year = {2017}
}
备注
Accepted at ICCV 2017