多模态表示模型的适配用于多任务外科计算机视觉
计算机视觉与模式识别
2025-07-11 v2 人工智能
摘要
外科人工智能通常涉及单个手术程序中的多个任务,例如相位识别或评估腔动胆囊切除术中的关键安全视图。传统模型针对单个任务构建,缺乏灵活性,需要为每个任务分别构建模型。为此,我们引入 MML-SurgAdapt,一个基于视觉语言模型 (VLM) 的统一多任务框架,具体为 CLIP,通过自然语言监督处理 diverse surgical tasks。多任务学习的关键挑战之一是整合不同任务时存在部分标注。在此基础上,我们采用单正多标签 (SPML) 学习,这种方法通过仅使用每个实例一个正标签来训练模型,从而减少标注负担。我们的框架将该方法扩展到单个程序内整合来自多个外科任务的数据,实现即使在不完整或噪声标注下也能有效学习。我们在由 Cholec80、Endoscapes2023 和 CholecT50 组成的联合数据集上演示了模型效果,采用自定义提示词。广泛的评估显示,MML-SurgAdapt 的性能相当于任务特定基准,同时具有处理噪声标注的优势。它还优于现有的 SPML 框架。通过将所需标签减少 23%,我们的方案提出了更可扩展、更高效的标注流程,显著减轻了临床医生的标注负担。据我们了解,这是首次将 SPML 应用于整合多个外科任务数据的应用,为外科计算机视觉中的多任务学习提供了新颖且可推广的解决方案。实现代码已公开:https://github.com/CAMMA-public/MML-SurgAdapt
引用
@article{arxiv.2507.05020,
title = {Adaptation of Multi-modal Representation Models for Multi-task Surgical Computer Vision},
author = {Soham Walimbe and Britty Baby and Vinkle Srivastav and Nicolas Padoy},
journal= {arXiv preprint arXiv:2507.05020},
year = {2025}
}