深度感知:基于单目深度先验的无训练外科场景分割
计算机视觉与模式识别
2025-12-08 v1 人工智能
摘要
像素级外科场景分割是计算机辅助手术中必不可少的任务,但由于稠密标注成本高昂,扩展性差。我们提出了深度引导的外科场景分割框架(DepSeg),该框架无需训练,利用单目深度作为几何先验结合预训练视觉基础模型。DepSeg 首先通过预训练的单目深度估计网络估计相对深度图,并提出深度引导的点提示方法,这些提示被 SAM2 转换为类别无关的掩码。随后,每个掩码通过池化后的预训练视觉特征描述,并通过基于已标注帧构建的模板库进行模板匹配分类。在 CholecSeg8k 数据集上,DepSeg 将直接使用的 SAM2 自动分割基线(35.9% vs. 14.7% mIoU)显著提升,甚至在仅使用 10--20% 对象模板时仍能保持竞争性能。这些结果表明,深度引导的提示和模板-based 分类方法提供了一种高效的分割方法。
引用
@article{arxiv.2512.05529,
title = {See in Depth: Training-Free Surgical Scene Segmentation with Monocular Depth Priors},
author = {Kunyi Yang and Qingyu Wang and Cheng Yuan and Yutong Ban},
journal= {arXiv preprint arXiv:2512.05529},
year = {2025}
}
备注
The first two authors contributed equally