中文

基于脉冲驱动的视频 Transformer 用于实时外科场景分割

计算机视觉与模式识别 2026-03-24 v2

摘要

现代外科系统越来越依赖智能场景理解以提高手术中的安全性和情境意识,外科场景分割在精细的外科感知中发挥着基本作用。尽管最近的人工神经网络模型,特别是大型基础模型,在准确性方面取得了令人印象深刻的成绩,但其高计算和能源需求常常阻碍在资源受限的手术环境中的部署。为此,我们探索使用 SNN 作为高度有效的范式。然而,其在外科场景分割中的表现仍受限于稀疏脉冲表征和有限的标注外科数据。因此,我们提出了 SpikeSurgSeg,即首个用于外科场景分割的脉冲驱动视频 Transformer。它保留了 SNN 的实时和能源效率优势,同时在数据稀缺的外科场景中实现与大多数 ANN 模型相当的性能。具体而言,我们引入基于 MAE 的脉冲感知预训练策略,通过脉冲发放活动引导掩码生成,以更好地与稀疏脉冲表征对齐,同时引入分层管状掩码方案以减少信息泄漏并鼓励情境推理。为进一步加强语义表征,我们引入多光谱知识蒸馏,将教师 ANN 和学生 SNN 的特征在频域对齐,其中连续激活模式与脉冲驱动的时间表征之间的不匹配可有效缓解。基于预训练的 SNN 编码器,我们进一步设计了一个轻量级脉冲驱动分割头。在 EndoVis18 和我们内部的 SurgBleed 数据集上进行大量实验表明,SpikeSurgSeg 在 mIoU 上与 SOTA ANN 模型相当,同时将推理延迟降低至少 8 倍。值得注意的是,它相对于大多数基础模型实现了 20 倍以上的加速。

关键词

引用

@article{arxiv.2512.21284,
  title  = {Toward Real-Time Surgical Scene Segmentation via a Spike-Driven Video Transformer with Spike-Informed Pretraining},
  author = {Shihao Zou and Jingjing Li and Wei Ji and Jincai Huang and Kai Wang and Guo Dan and Weixin Si and Yi Pan},
  journal= {arXiv preprint arXiv:2512.21284},
  year   = {2026}
}