利用深度与图像数据进行制造零件的多模态目标检测
计算机视觉与模式识别
2025-07-01 v3 人工智能
机器人学
摘要
制造业需要可靠的目标检测方法,以精确拾取和处理各类制造零件与组件。传统目标检测方法仅利用相机的 2D 图像或激光雷达等 3D 传感器的 3D 数据。然而,每种传感器都有弱点和局限:相机缺乏深度感知,3D 传感器通常不携带颜色信息。这些弱点会削弱工业制造系统的可靠性和鲁棒性。为应对这些挑战,本文提出了一种结合红-绿-蓝 (RGB) 相机和 3D 点云传感器的多传感器系统。两个传感器经过标定,实现从两个硬件设备捕获的多模态数据的精确对齐。开发了一种新颖的多模态目标检测方法来同时处理 RGB 和深度数据。该检测器基于原本仅处理相机图像的 Faster R-CNN 基线。结果表明,多模态模型在既定目标检测指标上显著优于仅深度和仅 RGB 基线。具体而言,与仅 RGB 基线相比,多模态模型将 mAP 提高了 13%,平均精度提高了 11.8%。与仅深度基线相比,mAP 提高了 78%,平均精度提高了 57%。因此,该方法为智能制造应用提供了更可靠、更鲁棒的目标检测。
引用
@article{arxiv.2411.09062,
title = {Multimodal Object Detection using Depth and Image Data for Manufacturing Parts},
author = {Nazanin Mahjourian and Vinh Nguyen},
journal= {arXiv preprint arXiv:2411.09062},
year = {2025}
}