中文

深度学习语义任务辅助的行人检测

计算机视觉与模式识别 2014-12-02 v1

摘要

深度学习方法凭借其从原始像素学习特征的能力,在行人检测中取得了巨大成功。然而,它们主要捕获中层表示,如行人姿态,但会将正样本与具有较大模糊性的困难负样本混淆,例如,在某些视角下,“树干”或“电线杆”的形状和外观与行人相似。这种模糊性可以通过高层表示来区分。为此,本工作将行人检测与语义任务联合优化,包括行人属性(例如“携带背包”)和场景属性(例如“道路”、“树木”和“水平”)。我们没有昂贵地标注场景属性,而是通过提出一种新颖的深度模型,从多个任务和多个数据源学习高层特征,将属性信息从现有的场景分割数据集迁移到行人数据集。由于不同任务具有不同的收敛速度,且来自不同数据集的数据具有不同的分布,我们精心设计了一个多任务目标函数来协调任务并减少数据集间的差异。该目标函数中任务的重要性系数和网络参数可以迭代估计。广泛的评估表明,所提出的方法在具有挑战性的 Caltech 和 ETH 数据集上优于当前最优技术,分别将先前深度模型的漏检率降低了 17% 和 5.5%。

关键词

引用

@article{arxiv.1412.0069,
  title  = {Pedestrian Detection aided by Deep Learning Semantic Tasks},
  author = {Yonglong Tian and Ping Luo and Xiaogang Wang and Xiaoou Tang},
  journal= {arXiv preprint arXiv:1412.0069},
  year   = {2014}
}