中文

面向实例感知人体语义解析的可微多粒度人体表征学习

计算机视觉与模式识别 2021-03-09 v1

摘要

为解决实例感知人体部位解析这一具有挑战性的任务,本文提出一种新的自底向上范式,以联合且端到端的方式学习类别级人体语义分割以及多人姿态估计。该框架紧凑、高效且强大,利用了不同人体粒度上的结构信息,并降低了人员划分的难度。具体而言,学习一个稠密到稀疏的投影场,其允许将稠密人体语义与稀疏关键点显式关联,并随着网络特征金字塔逐步改进以增强鲁棒性。随后,将困难的像素分组问题转化为一个更简单的多人关节组装任务。通过将关节关联表述为最大权二部匹配,开发了一种可微解法,利用投影梯度下降与 Dykstra 循环投影算法。这使得我们的方法可端到端训练,并允许将分组误差反向传播以直接监督多粒度人体表征学习。这与当前需要复杂后处理或启发式贪心算法的自底向上人体解析器或姿态估计器形成鲜明区别。在三个实例感知人体解析数据集上的实验表明,我们的模型以高得多的推理效率优于其他自底向上替代方法。

关键词

引用

@article{arxiv.2103.04570,
  title  = {Differentiable Multi-Granularity Human Representation Learning for Instance-Aware Human Semantic Parsing},
  author = {Tianfei Zhou and Wenguan Wang and Si Liu and Yi Yang and Luc Van Gool},
  journal= {arXiv preprint arXiv:2103.04570},
  year   = {2021}
}

备注

CVPR 2021 (Oral). Code: https://github.com/tfzhou/MG-HumanParsing