中文

Y-MAP-Net: RGB 图像中的实时深度、法线、分割、多标签描述生成与二维人体姿态

计算机视觉与模式识别 2024-11-18 v1

摘要

我们提出了 Y-MAP-Net,一种专为 RGB 图像实时多任务学习设计的 Y 形神经网络架构。Y-MAP-Net 通过单次网络前向传播,同时预测深度、表面法线、人体姿态、语义分割并生成多标签描述。为实现这一点,我们采用多教师单学生训练范式,由任务特定的基础模型监督网络学习,使其将这些模型的能力蒸馏进适合实时应用的轻量级架构中。Y-MAP-Net 展现出强泛化能力、简洁性和计算效率,使其成为机器人及其他实际场景的理想选择。为支持后续研究,我们将公开发布代码。

关键词

引用

@article{arxiv.2411.10334,
  title  = {Y-MAP-Net: Real-time depth, normals, segmentation, multi-label captioning and 2D human pose in RGB images},
  author = {Ammar Qammaz and Nikolaos Vasilikopoulos and Iason Oikonomidis and Antonis A. Argyros},
  journal= {arXiv preprint arXiv:2411.10334},
  year   = {2024}
}

备注

8 page paper, 6 Figures, 3 Tables