Surg-SegFormer:用于全景外科场景分割的双 Transformer 模型
图像与视频处理
2025-07-08 v1 人工智能
计算机视觉与模式识别
摘要
机器人辅助手术(robot-assisted surgery, RAS)中的全景外科场景分割能够帮助外科住院医生识别 various 解剖组织、可活动工具以及关键结构(如静脉和血管)。鉴于外科手术时间的紧迫性,外科医生提供详细实时解释的做法具有挑战性。这种挑战因外科专家数量不足而加剧,导致对操作场域中可行与不可行区域的明确描绘不够便捷。因此,高性能语义分割模型提供了解决方案,通过提供手术程序的清晰术后分析来弥补这一不足。然而,最近的先进分割模型依赖于用户生成的提示,在通常超过一个小时的手术视频中难以实用。为此,我们引入 Surg-SegFormer,一种 novel 无提示模型,性能优于当前最先进的技术。Surg-SegFormer 在 EndoVis2018 数据集上实现了 0.80 的平均交并比(mIoU),在 EndoVis2017 数据集上实现了 0.54。通过提供稳健且自动化的手术场景理解,该模型显著减轻了外科专家的辅导负担,使住院医生能够独立且有效地理解复杂的手术环境。
关键词
引用
@article{arxiv.2507.04304,
title = {Surg-SegFormer: A Dual Transformer-Based Model for Holistic Surgical Scene Segmentation},
author = {Fatimaelzahraa Ahmed and Muraam Abdel-Ghani and Muhammad Arsalan and Mahmoud Ali and Abdulaziz Al-Ali and Shidin Balakrishnan},
journal= {arXiv preprint arXiv:2507.04304},
year = {2025}
}
备注
Accepted in IEEE Case 2025