中文

理解拥挤场景中的人体:深度嵌套对抗学习及多人体解析新基准

计算机视觉与模式识别 2018-07-09 v3

摘要

尽管在检测、实例分割和人体解析等感知任务上取得了显著进展,计算机在视觉上理解拥挤场景中的人体(如群体行为分析、行人重识别、自动驾驶等)仍表现不佳。为此,模型需要全面感知多人体图像中的语义信息及实例间差异,该问题近期被定义为多人体解析任务。本文提出一个新的大规模数据库“多人体解析(MHP)”用于算法开发与评估,并推进了拥挤场景人体理解的最先进水平。MHP包含25,403张精细标注的图像,具有58个细粒度语义类别标签,每张图像涉及2-26人,拍摄于真实场景,涵盖多种视角、姿态、遮挡、交互与背景。我们进一步提出一种新颖的深度嵌套对抗网络(NAN)模型用于多人体解析。NAN由三个类生成对抗网络(GAN)的子网络组成,分别执行语义显著性预测、实例无关解析与实例感知聚类。这些子网络形成嵌套结构,并精心设计以端到端方式联合学习。NAN在我们的MHP及另外几个数据集上持续优于现有最先进方案,并作为强力基线推动多人体解析的未来研究。

关键词

引用

@article{arxiv.1804.03287,
  title  = {Understanding Humans in Crowded Scenes: Deep Nested Adversarial Learning and A New Benchmark for Multi-Human Parsing},
  author = {Jian Zhao and Jianshu Li and Yu Cheng and Li Zhou and Terence Sim and Shuicheng Yan and Jiashi Feng},
  journal= {arXiv preprint arXiv:1804.03287},
  year   = {2018}
}

备注

The first three authors are with equal contributions