中文

TV-SAM:利用 GPT-4 生成的描述性提示在无人工标注情况下提升多模态医学图像的零样本分割性能

计算机视觉与模式识别 2024-10-15 v2 人工智能

摘要

本研究提出了一种名为文本 - 视觉提示分割一切模型(TV-SAM)的新型多模态医学图像零样本分割算法,该算法无需任何人工标注。TV-SAM 整合了大语言模型 GPT-4、视觉语言模型 GLIP 以及 SAM,能够从医学图像中自动生成描述性文本提示和视觉边界框提示,从而增强 SAM 的零样本分割能力。我们在涵盖八种成像模态的七个公共数据集上进行了全面评估,结果表明 TV-SAM 能够有效分割各种模态下的未见目标,且无需额外训练。TV-SAM 的表现显著优于 SAM AUTO 和 GSAM,与使用金标准边界框提示的 SAM BBOX 性能相当,并在 ISIC 和 WBC 等特定数据集上超越了最先进的方法。研究表明,TV-SAM 是一种有效的多模态医学图像零样本分割算法,突显了 GPT-4 对零样本分割的重要贡献。通过整合 GPT-4、GLIP 和 SAM 等基础模型,可以增强解决专业领域复杂问题的能力。

关键词

引用

@article{arxiv.2402.15759,
  title  = {TV-SAM: Increasing Zero-Shot Segmentation Performance on Multimodal Medical Images Using GPT-4 Generated Descriptive Prompts Without Human Annotation},
  author = {Zekun Jiang and Dongjie Cheng and Ziyuan Qin and Jun Gao and Qicheng Lao and Abdullaev Bakhrom Ismoilovich and Urazboev Gayrat and Yuldashov Elyorbek and Bekchanov Habibullo and Defu Tang and LinJing Wei and Kang Li and Le Zhang},
  journal= {arXiv preprint arXiv:2402.15759},
  year   = {2024}
}

备注

13 pages, 5 figures, 4 tables, accepted by BDMA Journal