利用通用基础模型进行多模态外科数据分析
计算机视觉与模式识别
2025-09-09 v1
摘要
我们研究了通过迁移学习适应通用基础模型以及整合手术室(OR)来实现的补充模态数据,如何支持外科数据科学。为此,我们使用 V-JEPA 作为最小侵入式手术支持模型的单模态基础。我们分析了模型下游性能如何通过 (a) 在未标记的手术视频数据上进行微调以及 (b) 在多模态设置中提供来自 OR 的额外时间分辨数据来获得收益。在一组内数据集中的肝手术视频中,我们分析了预测住院长度和术后并发症的任务。在公开的 HeiCo 数据集的视频中,我们分析了手术阶段识别任务。作为基线,我们将预训练的 V-JEPA 应用于所有任务。然后我们在未标记的、保留下来的视频上对其进行微调,以探讨在特定领域适应后的性能变化。遵循模块化决策支持网络的思想,我们通过训练独立的编码器将来自 OR 的额外数据流整合进 V-JEPA 的嵌入中,以形成共享表示空间。我们的实验表明,在特定领域数据上的微调会增加模型性能。在内数据集上,整合额外的时间分辨数据同样有益。在 HeiCo 数据集上,预训练的视频-only、单模态基线设置的准确率与 EndoVis2017 挑战赛的最佳提交方案相当,而在特定领域数据上的微调进一步提高了准确率。我们的结果因此表明,外科数据科学可以利用公共的、通用的基础模型。同样,他们指示了特定领域适应和整合适当补充数据流来自 OR 的潜力。为支持进一步的研究,我们在 https://github.com/DigitalSurgeryLab-Basel/ML-CDS-2025 发布了代码和模型权重。
引用
@article{arxiv.2509.06831,
title = {Leveraging Generic Foundation Models for Multimodal Surgical Data Analysis},
author = {Simon Pezold and Jérôme A. Kurylec and Jan S. Liechti and Beat P. Müller and Joël L. Lavanchy},
journal= {arXiv preprint arXiv:2509.06831},
year = {2025}
}
备注
13 pages, 3 figures; accepted at ML-CDS @ MICCAI 2025, Daejeon, Republic of Korea