基于深度的特权信息用于增强RGB三维人体姿态估计
计算机视觉与模式识别
2024-09-18 v1
摘要
尽管计算机视觉研究近期取得了进展,但从单张RGB图像估计三维人体姿态仍然是一项具有挑战性的任务,因为多个三维姿态可能对应图像上相同的二维投影。在此背景下,深度数据可以通过提供关于场景中物体与相机之间距离的额外约束,帮助消除二维信息的歧义。遗憾的是,精确深度数据的获取仅限于室内空间,并且通常与特定的深度技术和设备绑定,从而限制了泛化能力。在本文中,我们提出了一种方法,能够在不损害其在以RGB相机为中心的广泛场景中的适用性和适应性的前提下,利用深度信息的优势。我们的方法包括一个基于热图的三维姿态估计器,该估计器利用特权信息范式,能够在推理时从RGB帧中幻觉出深度信息。更准确地说,深度信息仅在训练期间使用,通过强制我们基于RGB的幻觉网络学习与仅在深度数据上预训练的骨干网络相似的特征。这种方法即使在处理有限的小型数据集时也被证明是有效的。实验结果表明,特权信息范式显著增强了模型性能,使得仅使用RGB图像就能高效提取深度信息。
引用
@article{arxiv.2409.11104,
title = {Depth-based Privileged Information for Boosting 3D Human Pose Estimation on RGB},
author = {Alessandro Simoni and Francesco Marchetti and Guido Borghi and Federico Becattini and Davide Davoli and Lorenzo Garattoni and Gianpiero Francesca and Lorenzo Seidenari and Roberto Vezzani},
journal= {arXiv preprint arXiv:2409.11104},
year = {2024}
}
备注
ECCV 2024 Workshop T-CAP: TOWARDS A COMPLETE ANALYSIS OF PEOPLE: FINE-GRAINED UNDERSTANDING FOR REAL-WORLD APPLICATIONS