评估放射科视觉语言模型:全面分析
计算机视觉与模式识别
2025-04-23 v1 人工智能
摘要
基础模型通过自监督技术在大规模数据上进行训练,已成为医疗人工智能应用的前沿。本研究评估了三种不同的视觉语言基础模型(RAD-DINO、CheXagent 和 BiomedCLIP)在捕捉放射科任务中细粒度成像特征方面的能力。对这三种模型在肺气胫和心肌扩张的胸片分类、分割和回归任务中进行了评估。自监督的 RAD-DINO 在分割任务中始终表现出色,而文本监督的 CheXagent 在分类性能方面表现优异。BiomedCLIP 在不同任务之间的表现不一致。一种集成全局和局部特征的自定义分割模型显著提高了所有基础模型的性能,尤其是针对困难的肺气胫分割。研究发现,预训练方法对特定下游任务中的模型性能有着显著影响。对于细粒度分割任务,无文本监督训练的模型表现更好,而文本监督的模型在分类和可解释性方面具有优势。这些见解为在放射科临床应用中选择基础模型提供了指导。
引用
@article{arxiv.2504.16047,
title = {Evaluating Vision Language Models (VLMs) for Radiology: A Comprehensive Analysis},
author = {Frank Li and Hari Trivedi and Bardia Khosravi and Theo Dapamede and Mohammadreza Chavoshi and Abdulhameed Dere and Rohan Satya Isaac and Aawez Mansuri and Janice Newsome and Saptarshi Purkayastha and Judy Gichoya},
journal= {arXiv preprint arXiv:2504.16047},
year = {2025}
}