KTN:用于学习多人二维-三维对应关系的知识迁移网络
计算机视觉与模式识别
2022-06-23 v1
摘要
人体密集姿态估计旨在建立人体二维像素与三维人体模板之间的密集对应关系,是使机器理解图像中人物的关键技术。由于实际场景复杂且仅有部分标注可用,导致估计不完整或错误,该任务仍面临若干挑战。本文提出一种新颖的框架来检测图像中多人的密集姿态。所提方法称为知识迁移网络(Knowledge Transfer Network,KTN),解决了两个主要问题:1)如何精炼图像表征以缓解不完整估计;2)如何减少由低质量训练标签(即有限标注和类别不平衡标签)引起的错误估计。不同于现有工作直接传播区域金字塔特征进行密集姿态估计,KTN使用金字塔表征的精炼,在保持特征分辨率的同时抑制背景像素,该策略显著提升了精度。此外,KTN借助外部知识增强基于三维的身体解析能力,通过结构化身体知识图将基于充足标注训练的二维身体解析器转化为基于三维的身体解析器。由此显著降低了低质量标注带来的不利影响。KTN在DensePose-COCO数据集上优于最先进方法的优异性能证明了其有效性。在代表性任务(如人体分割、人体部位分割和关键点检测)及两种流行的密集姿态估计流程(即RCNN和全卷积框架)上的大量消融研究与实验结果,进一步表明了所提方法的泛化性。
引用
@article{arxiv.2206.10090,
title = {KTN: Knowledge Transfer Network for Learning Multi-person 2D-3D Correspondences},
author = {Xuanhan Wang and Lianli Gao and Yixuan Zhou and Jingkuan Song and Meng Wang},
journal= {arXiv preprint arXiv:2206.10090},
year = {2022}
}