优化手术场景的潜在图表示以实现零样本域迁移
计算机视觉与模式识别
2024-03-12 v1
摘要
目的:深度学习的进步催生了有效的手术视频分析模型;然而,由于手术流程、相机设置和患者人口统计学特征的差异导致的域偏移,这些模型往往难以在不同医疗中心之间泛化。近年来,以对象为中心的学习作为一种有前景的方法出现,用于改进手术场景理解,通过捕捉和解耦手术工具与解剖结构的视觉及语义属性来提升下游任务性能。在本工作中,我们对以对象为中心的方法进行了多中心性能基准测试,重点关注腹腔镜胆囊切除术中的安全关键视图评估,随后提出了一种针对未见域泛化的改进方法。方法:我们评估了四种用于域泛化的以对象为中心的方法,建立了基线性能。接下来,利用以对象为中心表示的解耦特性,我们通过一系列消融实验(例如,在下游分类中忽略视觉或语义特征)对其中一种方法进行了剖析。最后,基于这些消融实验的结果,我们开发了一种专门为域泛化优化的方法 LG-DG,该方法包含一种新颖的解耦损失函数。结果:我们的优化方法 LG-DG 相比最佳基线方法实现了 9.28% 的性能提升。更广泛地说,我们表明以对象为中心的方法因其模块化的表示学习方式,在域泛化方面非常有效。结论:我们研究了以对象为中心的方法在未见域泛化中的应用,识别了对性能至关重要的与方法无关的因素,并提出了一种显著优于现有方法的优化方案。
引用
@article{arxiv.2403.06953,
title = {Optimizing Latent Graph Representations of Surgical Scenes for Zero-Shot Domain Transfer},
author = {Siddhant Satyanaik and Aditya Murali and Deepak Alapatt and Xin Wang and Pietro Mascagni and Nicolas Padoy},
journal= {arXiv preprint arXiv:2403.06953},
year = {2024}
}
备注
7 pages, 3 figures, Accepted to IPCAI 2024