Y-MAP-Net: RGB 图像中的实时深度、法线、分割、多标签描述生成与二维人体姿态
计算机视觉与模式识别
2024-11-18 v1
摘要
我们提出了 Y-MAP-Net,一种专为 RGB 图像实时多任务学习设计的 Y 形神经网络架构。Y-MAP-Net 通过单次网络前向传播,同时预测深度、表面法线、人体姿态、语义分割并生成多标签描述。为实现这一点,我们采用多教师单学生训练范式,由任务特定的基础模型监督网络学习,使其将这些模型的能力蒸馏进适合实时应用的轻量级架构中。Y-MAP-Net 展现出强泛化能力、简洁性和计算效率,使其成为机器人及其他实际场景的理想选择。为支持后续研究,我们将公开发布代码。
引用
@article{arxiv.2411.10334,
title = {Y-MAP-Net: Real-time depth, normals, segmentation, multi-label captioning and 2D human pose in RGB images},
author = {Ammar Qammaz and Nikolaos Vasilikopoulos and Iason Oikonomidis and Antonis A. Argyros},
journal= {arXiv preprint arXiv:2411.10334},
year = {2024}
}
备注
8 page paper, 6 Figures, 3 Tables