基于视觉-语言模型的可文本提示手术器械分割
计算机视觉与模式识别
2024-06-05 v3
摘要
本文中,我们提出一种新颖的可文本提示手术器械分割方法,以克服微创手术中手术器械多样性和区分性相关的挑战。我们将该任务重新定义为可文本提示的,从而实现对手术器械更细致的理解并适应新型器械类型。受近期视觉-语言模型进展的启发,我们利用预训练的图像和文本编码器作为模型骨干,并设计了一个由基于注意力与卷积的提示方案组成的文本提示掩膜解码器用于手术器械分割预测。我们的模型通过一种新的提示混合机制为每个手术器械利用多个文本提示,从而提升分割性能。此外,我们引入了一个困难器械区域增强模块以改善图像特征理解与分割精度。在多个手术器械分割数据集上的大量实验证明了我们模型的优越性能与良好的泛化能力。据我们所知,这是首个可提示方法在手术器械分割上的实现,为机器人辅助手术领域的实际应用提供了重要潜力。代码见https://github.com/franciszzj/TP-SIS。
引用
@article{arxiv.2306.09244,
title = {Text Promptable Surgical Instrument Segmentation with Vision-Language Models},
author = {Zijian Zhou and Oluwatosin Alabi and Meng Wei and Tom Vercauteren and Miaojing Shi},
journal= {arXiv preprint arXiv:2306.09244},
year = {2024}
}
备注
NeurIPS 2023