中文

面向实时脊柱内镜实例分割的轻量级多尺度注意力框架

计算机视觉与模式识别 2025-12-29 v1

摘要

脊柱内镜的实时实例分割对于手术中识别和保护关键解剖结构非常重要,但由于视野狭窄、镜面高光、烟雾/出血、边界不清和尺度变化大,实现该任务十分困难。部署还受到手术硬件有限的约束,因此模型必须平衡精度和速度,并在小批量(甚至批量大小为 1)训练下保持稳定。我们提出 LMSF-A,一个跨主干、颈部和头部协同设计的轻量级多尺度注意力框架。主干使用 C2f-Pro 模块,将 RepViT 风格的重参数化卷积 (RVB) 与高效多尺度注意力 (EMA) 相结合,支持多分支训练并在推理时折叠为单一快速路径。颈部使用尺度序列特征融合 (SSFF) 和三重特征编码 (TFE) 改善跨尺度一致性和边界细节,增强高分辨率特征。头部采用带共享卷积和 GroupNorm 的轻量级多任务共享头 (LMSH),以减少参数并支持批量大小为 1 的稳定性。我们还发布了经临床审核的 PELD 数据集(61 名患者,610 张图像),包含脂肪组织、骨骼、黄韧带和神经的实例掩码。实验表明,LMSF-A 在所有评估指标上均具高度竞争力(甚至优于现有方法),且比大多数实例分割方法轻量得多,仅需 1.8M 参数和 8.8 GFLOPs,并能很好地泛化至公开的牙齿基准。代码和数据集:https://github.com/hhwmortal/PELD-Instance-segmentation。

关键词

引用

@article{arxiv.2512.21984,
  title  = {A Lightweight Multi-Scale Attention Framework for Real-Time Spinal Endoscopic Instance Segmentation},
  author = {Qi Lai and JunYan Li and Qiang Cai and Lei Wang and Tao Yan and XiaoKun Liang},
  journal= {arXiv preprint arXiv:2512.21984},
  year   = {2025}
}