中文

HAP:面向以人为中心感知的结构感知掩码图像建模

计算机视觉与模式识别 2023-11-01 v1 人工智能

摘要

模型预训练在以人为中心的感知中至关重要。本文中,我们首先引入掩码图像建模(MIM)作为该任务的预训练方法。在重新审视 MIM 训练策略后,我们揭示人体结构先验具有显著潜力。受此启发,我们进一步将一种直观的人体结构先验——人体部位——融入预训练。具体而言,我们利用该先验引导掩码采样过程。对应于人体部位区域的图像块被高优先级地掩码掉。这促使模型在预训练期间更关注身体结构信息,从而在一系列以人为中心的感知任务中带来显著收益。为进一步捕捉人体特征,我们提出结构不变对齐损失,强制由人体部位先验引导的同一图像的不同掩码视图紧密对齐。我们将整个方法称为 HAP。HAP 仅使用普通 ViT 作为编码器,却在11个以人为中心的基准上建立了新的最先进性能,并在一个数据集上取得相当结果。例如,HAP 在 MSMT17 上取得78.1% mAP(行人重识别),在 PA-100K 上取得86.54% mA(行人属性识别),在 MS COCO 上取得78.2% AP(2D姿态估计),在 3DPW 上取得56.0 PA-MPJPE(3D姿态与形状估计)。

关键词

引用

@article{arxiv.2310.20695,
  title  = {HAP: Structure-Aware Masked Image Modeling for Human-Centric Perception},
  author = {Junkun Yuan and Xinyu Zhang and Hao Zhou and Jian Wang and Zhongwei Qiu and Zhiyin Shao and Shaofeng Zhang and Sifan Long and Kun Kuang and Kun Yao and Junyu Han and Errui Ding and Lanfen Lin and Fei Wu and Jingdong Wang},
  journal= {arXiv preprint arXiv:2310.20695},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023