RGB-D图像帧的语义分割与场景重建:面向机器人应用的端到端模块化流水线
计算机视觉与模式识别
2025-04-24 v2 机器人学
摘要
在非结构化环境中运行的机器人需要全面理解其周围环境,这要求从传感器数据中获取几何和语义信息。传统的RGB-D处理流水线主要关注几何重建,限制了其支持高级机器人感知、规划和交互的能力。一个关键挑战是缺乏将RGB-D数据分割成语义上有意义的组件同时保持精确几何表示的通用方法。我们引入了一种新颖的端到端模块化流水线,集成了最先进的语义分割、人体跟踪、点云融合和场景重建。我们的方法通过利用基础分割模型SAM2并结合一种混合方法(将其掩码生成与语义分类模型相结合)来提高语义分割精度,从而产生更清晰的掩码和较高的分类精度。与SegFormer和OneFormer相比,我们的方法实现了相似的语义分割精度(在ADE20K数据集上mIoU为47.0%对45.9%),但提供了更精确的对象边界。此外,我们的人体跟踪算法与分割交互,通过对象重识别实现了即使在对象离开并重新进入帧时也能连续跟踪。我们的点云融合方法通过利用语义信息将计算时间减少了1.81倍,同时保持了25.3毫米的小平均重建误差。我们在基准数据集和真实世界的Kinect RGB-D数据上验证了我们的方法,展示了改进的效率、准确性和可用性。我们的结构化表示以通用场景描述(USD)格式存储,支持高效的查询、可视化和机器人仿真,使其适用于实际部署。
引用
@article{arxiv.2410.17988,
title = {Semantic Segmentation and Scene Reconstruction of RGB-D Image Frames: An End-to-End Modular Pipeline for Robotic Applications},
author = {Zhiwu Zheng and Lauren Mentzer and Berk Iskender and Michael Price and Colm Prendergast and Audren Cloitre},
journal= {arXiv preprint arXiv:2410.17988},
year = {2025}
}