利用视觉语言模型与简单形状及纹理文本描述符的少样本医学图像分类
计算机视觉与模式识别
2023-08-09 v1
摘要
在本工作中,我们探究了视觉语言模型(VLMs)与大语言模型在医学图像二分类少样本任务中的效用。我们利用GPT-4模型生成涵盖医学图像中物体形状与纹理特征的描述符。随后,这些由GPT-4生成的描述符与在自然图像上预训练的VLMs被用于分类胸部X光与乳腺超声图像。我们的结果表明,使用VLMs与GPT-4生成描述符进行医学图像少样本分类是一种可行方法。然而,精确分类需要在分类分数计算时排除特定描述符。此外,我们评估了VLMs在乳腺肿块超声图像中评估形状特征的能力。我们进一步探究了GPT-4所生成文本描述符集合间的变异程度。我们的工作为VLMs在医学图像分析中的应用提供了若干重要见解。
引用
@article{arxiv.2308.04005,
title = {Few-shot medical image classification with simple shape and texture text descriptors using vision-language models},
author = {Michal Byra and Muhammad Febrian Rachmadi and Henrik Skibbe},
journal= {arXiv preprint arXiv:2308.04005},
year = {2023}
}
备注
13 pages, 5 figures