视觉编译器:合成场景特定的行人检测器与姿态估计器
计算机视觉与模式识别
2016-12-16 v1
摘要
我们引入了视觉编译器的概念,其在没有任何行人观测的情况下生成场景特定的行人检测器与姿态估计器。给定单幅图像以及以相机参数和场景几何布局形式提供的辅助场景信息,视觉编译器首先通过使用计算机图形学渲染来推断该场景中几何和光度精确的人体图像。利用这些渲染图像,我们学习一个场景和区域特定的空间变化全卷积神经网络,用于行人的同时检测、姿态估计与分割。我们证明,当真实人类标注数据稀缺或不存在时,我们的数据生成策略可为引导式人类检测与姿态估计提供极好的解决方案。实验结果表明,我们的方法优于在真实数据上训练的现成最先进行人检测器与姿态估计器。
引用
@article{arxiv.1612.05234,
title = {Visual Compiler: Synthesizing a Scene-Specific Pedestrian Detector and Pose Estimator},
author = {Namhoon Lee and Xinshuo Weng and Vishnu Naresh Boddeti and Yu Zhang and Fares Beainy and Kris Kitani and Takeo Kanade},
journal= {arXiv preprint arXiv:1612.05234},
year = {2016}
}
备注
submitted to CVPR 2017