Bimodal SegNet:融合事件与RGB帧用于机器人抓取实例分割
计算机视觉与模式识别
2025-12-09 v3
摘要
动态条件下用于机器人抓取的目标分割常面临遮挡、低光照、运动模糊和目标尺寸变化等挑战。为应对这些挑战,我们提出了一种融合两类视觉信号(基于事件的数据和RGB帧数据)的深度学习网络。所提出的Bimodal SegNet网络具有两个独立的编码器,分别处理每种信号输入,以及带有空洞卷积的空间金字塔池化。编码器通过在不同分辨率下对拼接特征进行池化来捕获丰富的上下文信息,而解码器获得清晰的目标边界。对所提方法的评估在基于事件的分割(ESD)数据集上进行了五项独特的图像退化挑战,包括遮挡、模糊、亮度、轨迹和尺度变化。评估结果显示,在平均交并比和像素精度方面,相比最先进的方法分割精度提升了6-10%。模型代码可在 https://github.com/sanket0707/Bimodal-SegNet.git 获取。
引用
@article{arxiv.2303.11228,
title = {Bimodal SegNet: Instance Segmentation Fusing Events and RGB Frames for Robotic Grasping},
author = {Sanket Kachole and Xiaoqian Huang and Fariborz Baghaei Naeini and Rajkumar Muthusamy and Dimitrios Makris and Yahya Zweiri},
journal= {arXiv preprint arXiv:2303.11228},
year = {2025}
}
备注
8 Pages