中文

剖析用于外科计算机视觉的自监督学习方法

计算机视觉与模式识别 2023-06-01 v3

摘要

近年来,随着基于深度神经网络方法的日益流行,外科计算机视觉领域取得了可观突破。然而,训练此类模型的标准全监督方法需要大量标注数据,带来了极高成本,尤其在临床领域。自监督学习(SSL)方法已在通用计算机视觉界开始获得关注,代表了解决这些标注成本的潜在方案,允许仅从无标签数据学习有用表征。尽管如此,SSL 方法在如医学与外科等更复杂且具重大影响的领域中的有效性仍有限且未被探索。本工作中,我们通过对四种最先进 SSL 方法(MoCo v2、SimCLR、DINO、SwAV)在外科计算机视觉背景下进行调查,来解决这一关键需求。我们针对 Cholec80 数据集上外科情境理解中两项基础且流行的任务(阶段识别与器械存在检测)呈现了这些方法性能的广泛分析。我们考察了它们的参数化,以及它们在半监督设定下相对于训练数据量的行为。如本工作所描述与实施的这些方法向外科的正确迁移,带来了相较 SSL 通用使用的显著性能提升——阶段识别上最高 7.4%,器械存在检测上最高 20%——并且相较最先进半监督阶段识别方法最高提升 14%。在高度多样化的外科数据集上获得的进一步结果展现出强大的泛化特性。代码见 https://github.com/CAMMA-public/SelfSupSurg。

关键词

引用

@article{arxiv.2207.00449,
  title  = {Dissecting Self-Supervised Learning Methods for Surgical Computer Vision},
  author = {Sanat Ramesh and Vinkle Srivastav and Deepak Alapatt and Tong Yu and Aditya Murali and Luca Sestini and Chinedu Innocent Nwoye and Idris Hamoud and Saurav Sharma and Antoine Fleurentin and Georgios Exarchakis and Alexandros Karargyris and Nicolas Padoy},
  journal= {arXiv preprint arXiv:2207.00449},
  year   = {2023}
}