中文

基准测试 CNN 与 Transformer 模型在机器人辅助手术中的外科器械分割

计算机视觉与模式识别 2026-04-13 v1 斑图形成与孤子

摘要

在机器人辅助手术中,对外科器械的精准分割对于实现基于上下文的数据驱动干预(如工具跟踪、工作流程分析和自主决策)至关重要。本研究在 SAR-RARP50 数据集上对五种深度学习架构(UNet、UNet、DeepLabV3、Attention UNet 和 SegFormer)进行基准测试,用于实践性根除前列腺手术视频中外科器械的多类语义分割。这些模型采用组合损失函数进行训练,该损失函数结合交叉熵损失和 Dice 损失,以解决类别不平衡问题并捕捉精细物体边界。我们的实验结果表明,尽管卷积模型如 UNet 和 Attention UNet 提供了强大的基线性能,但 DeepLabV3 的结果不输于 SegFormer,表明稀疏卷积和多尺度上下文聚合在捕捉复杂外科场景方面有效。Transformer-based 架构如 SegFormer 进一步增强了全局上下文理解,从而在不同器械外观和手术条件下实现更好的泛化。本工作提供了全面的比较和实际见解,用于在外科人工智能应用中选择分割模型,突出卷积和 Transformer 方法之间的权衡。

关键词

引用

@article{arxiv.2604.09151,
  title  = {Benchmarking CNN- and Transformer-Based Models for Surgical Instrument Segmentation in Robotic-Assisted Surgery},
  author = {Sara Ameli},
  journal= {arXiv preprint arXiv:2604.09151},
  year   = {2026}
}