扩大自监督学习规模以提升外科基础模型性能
计算机视觉与模式识别
2025-11-26 v1
摘要
基础模型通过在大规模数据集上的大规模预训练,已在计算机视觉领域实现显著优势,跨越多种任务。然而,其在外科计算机视觉中的应用仍受限。本研究填补这一空白,提出 SurgeNetXL,一种新颖的外科基础模型,为外科计算机视觉树立了新纪录。 SurgeNetXL 训练于目前报告的最大外科数据集,包含超过 470 万视频帧。模型在覆盖四种手术程序和三种任务(语义分割、阶段识别和关键安全视图 (CVS) 分类)的六个数据集上始终达到顶尖水平。与最佳手术基础模型相比, SurgeNetXL 在语义分割、阶段识别和 CVS 分类分别提升 2.4、9.0 和 12.6 个百分点。此外, SurgeNetXL 在相应任务中比最佳的 ImageNet 变体高出 14.4、4.0 和 1.6 个百分点。除了推进模型性能外,本研究为在外科计算机视觉中扩大预训练数据规模、延长训练时长以及针对该领域优化模型架构提供了关键见解。这些发现为提高数据稀缺场景下的可泛化性和鲁棒性铺平了道路,为该领域的未来研究提供了完整框架。所有模型及 SurgeNetXL 数据集的子集(包含超过 200 万视频帧)均公开提供,地址为:https://github.com/TimJaspers0801/SurgeNet。
引用
@article{arxiv.2501.09436,
title = {Scaling up self-supervised learning for improved surgical foundation models},
author = {Tim J. M. Jaspers and Ronald L. P. D. de Jong and Yiping Li and Carolus H. J. Kusters and Franciscus H. A. Bakker and Romy C. van Jaarsveld and Gino M. Kuiper and Richard van Hillegersberg and Jelle P. Ruurda and Willem M. Brinkman and Josien P. W. Pluim and Peter H. N. de With and Marcel Breeuwer and Yasmina Al Khalil and Fons van der Sommen},
journal= {arXiv preprint arXiv:2501.09436},
year = {2025}
}