启动外科手术计算机视觉
计算机视觉与模式识别
2025-07-17 v2
摘要
研究人员和工业界的共识指出,缺乏大型、有代表性的标注数据集是外科数据科学领域进步的最大障碍。自监督学习(SSL)的进展代表了一种解决方案,它通过提供任务无关的初始化来减少对大型标注数据集的依赖。然而,当前自监督学习方法对领域偏移的鲁棒性仍不明确,这限制了我们对其利用多样化外科数据源效用的理解。我们将焦点从方法转向数据,证明了基于 SSL 初始化的下游价值与预训练数据集的构成错综复杂地交织在一起。这些结果突显了在我们扩展自监督方法以构建通用“基础模型”,从而支持外科领域内多样化用例时,需要填补的一个重要空白。通过多个阶段的受控实验,我们基于超过 300 个实验(涵盖 20 个预训练数据集、9 种外科手术、7 个中心(医院)、3 种标注数据设置、3 个下游任务和多次运行)的证据,为预训练数据集构成制定了建议。使用本文描述的方法,我们在两个公开的相位识别基准测试中超越了最先进的预训练:在 Cholec80 上提升高达 2.2%,在 AutoLaparo 上提升高达 5.1%。
引用
@article{arxiv.2312.05968,
title = {Jumpstarting Surgical Computer Vision},
author = {Deepak Alapatt and Aditya Murali and Vinkle Srivastav and Pietro Mascagni and AI4SafeChole Consortium and Nicolas Padoy},
journal= {arXiv preprint arXiv:2312.05968},
year = {2025}
}
备注
7 pages, 3 figures