RepParser:基于代表性部件的单阶段端到端多人解析框架
计算机视觉与模式识别
2022-08-30 v1
摘要
现有的多人解析方法通常采用两阶段策略(典型为自顶向下与自底向上),其缺陷在于要么严重依赖先验检测,要么在后分组过程中存在高度计算冗余。本文提出一种基于代表性部件的单阶段端到端多人解析框架,称为 RepParser。与主流方法不同,RepParser 以一种新的单阶段方式解决多人解析问题,无需借助人体检测或后分组。为此,RepParser 将解析流程解耦为实例感知核生成与部件感知人体解析,分别负责实例分离与实例特定的部件分割。特别地,我们利用代表性部件来增强解析流程,因为它们以实例感知关键点为特征,并可用于动态解析每个人体实例。具体而言,代表性部件通过联合定位实例中心与估计身体部件区域关键点获得。此后,我们通过代表性部件动态预测实例感知卷积核,从而将人-部件上下文编码进每个负责将图像特征转换为实例特定表示的核中。此外,采用多分支结构将每个实例特定表示划分为若干部件感知表示以进行独立部件分割。由此,RepParser 在代表性部件引导下聚焦于人体实例并直接输出每个人体实例的解析结果,从而消除对先验检测或后分组的需求。在两个具有挑战性的基准上的大量实验表明,我们所提出的 RepParser 是一个简洁而有效的框架,并取得了极具竞争力的性能。
引用
@article{arxiv.2208.12908,
title = {RepParser: End-to-End Multiple Human Parsing with Representative Parts},
author = {Xiaojia Chen and Xuanhan Wang and Lianli Gao and Jingkuan Song},
journal= {arXiv preprint arXiv:2208.12908},
year = {2022}
}