面向细粒度多标签安全视野识别的多模态表示
计算机视觉与模式识别
2025-07-11 v2 人工智能
摘要
安全视野(CVS)对于安全的腹腔镜胆囊切除术至关重要,然而评估CVS标准即使对专家来说也是一项复杂且具有挑战性的任务。传统的CVS识别模型依赖于仅视觉模型,需要昂贵且劳动密集的空间标注。本研究探讨了如何利用文本作为多模态手术基础模型在训练和推理中的强大工具,以实现CVS识别的自动化。与许多主要适用于多类分类的现有多模态模型不同,CVS识别需要一个多标签框架。对现有手术多模态模型的零样本评估显示,该任务存在显著的性能差距。为此,我们提出CVS-AdaptNet,一种多标签适配策略,通过使用正向和负向提示将图像嵌入与每个CVS标准的文本描述对齐,来增强跨多个标签的细粒度二分类。通过将最先进的手术基础模型PeskaVLP适配到Endoscapes-CVS201数据集,CVS-AdaptNet达到了57.6 mAP,比仅使用图像的ResNet50基线(51.5 mAP)提高了6个点。我们的结果表明,CVS-AdaptNet的多标签、多模态框架,通过文本提示增强,比仅使用图像的方法提升了CVS识别性能。我们还提出了文本特定的推理方法,有助于分析图像-文本对齐。虽然还需要进一步工作以匹配最先进的基于空间标注的方法,但该方法突显了将通用模型适配到专门手术任务的潜力。代码:https://github.com/CAMMA-public/CVS-AdaptNet
引用
@article{arxiv.2507.05007,
title = {Multi-modal Representations for Fine-grained Multi-label Critical View of Safety Recognition},
author = {Britty Baby and Vinkle Srivastav and Pooja P. Jain and Kun Yuan and Pietro Mascagni and Nicolas Padoy},
journal= {arXiv preprint arXiv:2507.05007},
year = {2025}
}