中文

基于文本驱动的手术工作流程少样本适应方法

计算机视觉与模式识别 2025-03-04 v3 人工智能

摘要

目的:手术工作流程分析对于提高手术效率和安全性至关重要,但以往研究依赖于大规模标注数据集,带来成本高、可扩展性差以及依赖专家标注等挑战。为此,我们提出了 Surg-FTDA(Few-shot Text-driven Adaptation),旨在以最小的配对图像-标签数据处理各种手术工作流程分析任务。方法:我们的方法包含两个关键组件。首先,基于少样本选择的模态对齐,从下游任务中选择一小部分图像并将其嵌入与文本嵌入对齐,从而弥合模态鸿沟。其次,文本驱动适应仅使用文本数据训练解码器,无需配对的图像-文本数据。该解码器随后应用于对齐后的图像嵌入中,实现无需显式图像-文本配对即可完成图像相关任务。结果:我们评估了该方法在生成任务(图像字幕)和判别式任务(三元组识别和阶段识别)中的表现。结果表明,Surg-FTDA 在各下游任务中均优于基线方法,并表现出良好的跨任务泛化能力。结论:我们提出了一种文本驱动的适应方法,弥合了模态鸿沟,能够在手术工作流程分析中处理多个下游任务,且对大规模标注数据依赖较小。该代码和数据集将发布于 https://github.com/CAMMA-public/Surg-FTDA。

关键词

引用

@article{arxiv.2501.09555,
  title  = {Text-driven Adaptation of Foundation Models for Few-shot Surgical Workflow Analysis},
  author = {Tingxuan Chen and Kun Yuan and Vinkle Srivastav and Nassir Navab and Nicolas Padoy},
  journal= {arXiv preprint arXiv:2501.09555},
  year   = {2025}
}