中文

基于图神经网络的外科场景分割

计算机视觉与模式识别 2025-11-21 v1 机器学习

摘要

目的:准确识别肝胆解剖对于预防腹式胆囊切除术的外科并发症至关重要。深度学习模型常在遮挡、长程依赖和捕捉稀有结构细粒度几何方面受限。本工作通过引入基于图的分割方法来增强外科场景分析中的空间和语义理解。Methods: 我们提出两种分割模型,将Vision Transformer(ViT)特征编码器与图神经网络(GNN)集成,以显式建模解剖区域之间的空间关系。(1)采用带初始残差和恒等映射(GCNII)的静态k近邻(k-NN)图,实现稳定的长程信息传播。(2)采用图注意力网络(GAT)支持的动态可微图生成器(DGG),实现自适应拓扑学习。两种模型在Endoscapes-Seg50和CholecSeg8k基准上进行评估。Results: 所提方法在平均交并比(mIoU)上实现最高7-8%的提升,在平均Dice系数(mDice)上实现6%的提升,优于最新基线。它产生解剖上连贯的预测,尤其在细长、稀有和安全关键结构上效果显著。Conclusion: 所提图基分割方法增强了外科场景分割中的性能和解剖一致性。通过将ViT-based全局上下文与图基关系推理结合,模型提高了可解释性和可靠性,为通过精确识别关键解剖特征实现更安全的腹式和机器人辅助手术铺路了道。

关键词

引用

@article{arxiv.2511.16430,
  title  = {Graph Neural Networks for Surgical Scene Segmentation},
  author = {Yihan Li and Nikhil Churamani and Maria Robu and Imanol Luengo and Danail Stoyanov},
  journal= {arXiv preprint arXiv:2511.16430},
  year   = {2025}
}

备注

12 pages, 4 figures, 3 tables