基于主动模板回归的深度人体解析
计算机视觉与模式识别
2016-11-15 v1
摘要
在这项工作中,人体解析任务,即将一幅人体图像分解为语义服装/身体区域,被建模为一个主动模板回归(ATR)问题,其中每个服装/身体物品的归一化掩码表示为学习到的掩码模板的线性组合,然后通过主动形状参数(包括每个语义区域的位置、尺度和可见性)变形为更精确的掩码。掩码模板系数与主动形状参数共同生成人体解析结果,因此被称为人体解析的结构化输出。利用深度卷积神经网络(CNN)来建立输入人体图像与人体解析结构化输出之间的端到端关系。更具体地说,结构化输出由两个独立的网络预测。第一个CNN网络带有最大池化,旨在预测每个标签掩码的模板系数;而第二个CNN网络不带最大池化,以保持对标签掩码位置的敏感性并准确预测主动形状参数。对于一幅新图像,两个网络的结构化输出被融合以生成每个像素属于每个标签的概率,最后使用超像素平滑来优化人体解析结果。在大型数据集上的综合评估充分证明了ATR框架相对于其他最先进的人体解析方法具有显著优越性。特别地,我们的ATR框架的F1分数达到,显著高于基于最先进算法的。
引用
@article{arxiv.1503.02391,
title = {Deep Human Parsing with Active Template Regression},
author = {Xiaodan Liang and Si Liu and Xiaohui Shen and Jianchao Yang and Luoqi Liu and Jian Dong and Liang Lin and Shuicheng Yan},
journal= {arXiv preprint arXiv:1503.02391},
year = {2016}
}
备注
This manuscript is the accepted version for IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 2015