重思考手术数据集中RGB-D融合用于语义分割
计算机视觉与模式识别
2024-07-30 v1 人工智能
摘要
手术场景理解是实现智能且情境感知系统的关键技术,可变革各种手术干预方面的应用。本文聚焦于语义分割任务,提出一种简单而有效的多模态(RGB和深度)训练框架,称为SurgDepth,并在所有可用于此任务的公开数据集上实现了最先进(SOTA)结果。不同于以往方法,SurgDepth基于Vision Transformer(ViT),设计通过简单融合机制对RGB和深度信息进行编码。我们在EndoVis2022、AutoLapro、LapI2I和EndoVis2017等基准数据集上进行了大量实验,以验证SurgDepth的有效性。具体而言,SurgDepth在EndoVis 2022 SAR-RARP50挑战赛上实现了0.86的新SOTA IoU,并使用由ConvNeXt块构成的浅层且计算高效的解码器,超过当前最佳方法至少提高4%。
引用
@article{arxiv.2407.19714,
title = {Rethinking RGB-D Fusion for Semantic Segmentation in Surgical Datasets},
author = {Muhammad Abdullah Jamal and Omid Mohareri},
journal= {arXiv preprint arXiv:2407.19714},
year = {2024}
}