中文

fine-CLIP:利用视觉-语言模型增强零样本细粒度手术动作识别

计算机视觉与模式识别 2025-03-30 v1

摘要

尽管 CLIP 等视觉-语言模型在零样本手术阶段识别方面取得了进展,但它们在细粒度手术活动(尤其是动作三元组)上仍存在困难。这一局限源于现有 CLIP 形式依赖于全局图像特征,忽略了对于零样本三元组识别等复杂任务至关重要的细粒度语义和上下文细节。此外,这些模型未探索三元组中固有的层次结构,削弱了它们对新颖三元组的泛化能力。为应对这些挑战,我们提出 fine-CLIP,它学习以物体为中心的特征,并利用三元组表述中的层次结构。我们的方法集成了三个组件:用于捕获共享语义的层次化提示建模、基于 LoRA 的视觉骨干网络自适应以增强特征提取,以及一种基于图的凝聚策略,将相似的 patch 特征归并为有意义的物体簇。由于三元组分类是一项具有挑战性的任务,我们在 CholecT50 数据集上引入了一种替代但有意义的基类到新类泛化基准,包含两种设置:Unseen-Target,评估对具有新颖解剖结构的三元组的适应性;以及 Unseen-Instrument-Verb,要求模型泛化到新颖的器械-动作交互。fine-CLIP 在 F1 和 mAP 上取得了显著提升,增强了对新颖手术三元组的零样本识别能力。

关键词

引用

@article{arxiv.2503.19670,
  title  = {fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models},
  author = {Saurav Sharma and Didier Mutter and Nicolas Padoy},
  journal= {arXiv preprint arXiv:2503.19670},
  year   = {2025}
}

备注

6 pages, 3 tables, 3 figures