CLIFF:将全帧中的位置信息引入人体姿态与形状估计
计算机视觉与模式识别
2022-09-22 v2
摘要
自顶向下方法主导了三维人体姿态与形状估计领域,因为它们与人类检测解耦,使研究者能聚焦于核心问题。然而,其第一步的裁剪从最开始就丢弃了位置信息,导致它们无法准确预测原始相机坐标系中的全局旋转。为解决此问题,我们提出将全帧中的位置信息(CLIFF)引入该任务。具体而言,我们将裁剪图像特征与其边界框信息拼接,向 CLIFF 输入更整体的特征。我们以全帧的更广阔视野计算二维重投影损失,采用类似于人体在图像中投影的投影过程。在全局位置感知信息馈入与监督下,CLIFF 直接预测全局旋转及更精确的关节姿态。此外,我们提出基于 CLIFF 的伪真值标注器,为野外二维数据集提供高质量三维标注,并为基于回归的方法提供关键的完全监督。在流行基准上的大量实验表明,CLIFF 大幅优于先前方法,并在 AGORA 排行榜(SMPL-Algorithms 赛道)位居第一。代码与数据见 https://github.com/huawei-noah/noah-research/tree/master/CLIFF。
引用
@article{arxiv.2208.00571,
title = {CLIFF: Carrying Location Information in Full Frames into Human Pose and Shape Estimation},
author = {Zhihao Li and Jianzhuang Liu and Zhensong Zhang and Songcen Xu and Youliang Yan},
journal= {arXiv preprint arXiv:2208.00571},
year = {2022}
}
备注
update the related work upon v1 with small modifications