中文

InsPose:用于单阶段多人姿态估计的实例感知网络

计算机视觉与模式识别 2022-04-25 v3

摘要

多人姿态估计是一项引人注目且具有挑战性的任务。现有方法大多基于两阶段框架,包括自顶向下和自底向上方法。两阶段方法要么因额外的人体检测器而遭受高计算冗余,要么需要在预测所有实例无关关键点后进行启发式关键点分组。单阶段范式旨在简化多人姿态估计流程并受到大量关注。然而,近期单阶段方法由于难以从单一特征向量回归各种全身姿态而存在性能较低的局限。与以往涉及复杂启发式设计的方案不同,我们提出一种简单而有效的解决方案,即采用实例感知动态网络。具体而言,我们提出一个实例感知模块,为每个实例自适应调整(部分)网络参数。我们的方案能显著提升网络识别各种姿态的容量与自适应能力,同时保持紧凑的端到端可训练流程。在 MS-COCO 数据集上的大量实验表明,我们的方法相比现有单阶段方法取得显著改进,并与最先进的两阶段方法相比实现了精度与效率的更好平衡。代码与模型见 \url{https://github.com/hikvision-research/opera}。

关键词

引用

@article{arxiv.2107.08982,
  title  = {InsPose: Instance-Aware Networks for Single-Stage Multi-Person Pose Estimation},
  author = {Dahu Shi and Xing Wei and Xiaodong Yu and Wenming Tan and Ye Ren and Shiliang Pu},
  journal= {arXiv preprint arXiv:2107.08982},
  year   = {2022}
}