中文

基于 RGB-D Transformer 的高效多任务场景分析

计算机视觉与模式识别 2026-01-05 v2 机器人学

摘要

场景分析对于使移动机器人等自主系统能够在真实世界环境中运行至关重要。然而,要全面理解场景需要解决多个任务,例如全景分割、实例方向估计和场景分类。在移动平台有限的计算和电池能力下解决这些任务具有挑战性。为应对这一挑战,我们提出了一种高效的多任务场景分析方法,称为 EMSAFormer,它使用基于 RGB-D Transformer 的编码器同时执行上述任务。我们的方法建立在先前发表的 EMSANet 之上。然而,我们表明 EMSANet 的双 CNN 编码器可以用单个基于 Transformer 的编码器替代。为此,我们研究了如何在一个编码器中有效融合来自 RGB 和深度数据的信息。为加速在机器人硬件上的推理,我们提供了自定义的 NVIDIA TensorRT 扩展,可对我们的 EMSAFormer 方法进行高度优化。通过在常用室内数据集 NYUv2、SUNRGB-D 和 ScanNet 上的大量实验,我们表明我们的方法在 NVIDIA Jetson AGX Orin 32 GB 上仍能以高达 39.1 FPS 的推理速度实现最先进的性能。

关键词

引用

@article{arxiv.2306.05242,
  title  = {Efficient Multi-Task Scene Analysis with RGB-D Transformers},
  author = {Söhnke Benedikt Fischedick and Daniel Seichter and Robin Schmidt and Leonard Rabes and Horst-Michael Gross},
  journal= {arXiv preprint arXiv:2306.05242},
  year   = {2026}
}

备注

Published in Proc. International Joint Conference on Neural Networks (IJCNN 2023)