RadVLM:面向放射学的多任务对话式视觉-语言模型
计算机视觉与模式识别
2025-10-13 v2 人工智能
摘要
胸部X光片(CXR)的广泛使用,加之放射科医生的短缺,推动了对自动化CXR分析和AI辅助报告日益增长的兴趣。虽然现有的视觉-语言模型(VLM)在报告生成或异常检测等特定任务中显示出潜力,但它们通常缺乏对交互式诊断能力的支持。在这项工作中,我们提出了RadVLM,这是一个紧凑的、多任务的对话式基础模型,专为CXR解读而设计。为此,我们整理了一个大规模指令数据集,包含超过100万个图像-指令对,其中既有单轮任务——如报告生成、异常分类和视觉定位——也有多轮、多任务的对话交互。在此指令数据集上微调RadVLM后,我们将其与重新实现的基线VLM在不同任务上进行了评估。我们的结果表明,RadVLM在对话能力和视觉定位方面达到了最先进的性能,同时在其他放射学任务中保持竞争力。消融研究进一步凸显了跨多个任务联合训练的优势,尤其是在标注数据有限的场景下。这些发现共同凸显了RadVLM作为临床相关放射式助手的潜力,它提供结构化的CXR解读和对话能力,以支持更有效和可及的诊断工作流程。
引用
@article{arxiv.2502.03333,
title = {RadVLM: A Multitask Conversational Vision-Language Model for Radiology},
author = {Nicolas Deperrois and Hidetoshi Matsuo and Samuel Ruipérez-Campillo and Moritz Vandenhirtz and Sonia Laguna and Alain Ryser and Koji Fujimoto and Mizuho Nishio and Thomas M. Sutter and Julia E. Vogt and Jonas Kluckert and Thomas Frauenfelder and Christian Blüthgen and Farhad Nooralahzadeh and Michael Krauthammer},
journal= {arXiv preprint arXiv:2502.03333},
year = {2025}
}
备注
21 pages, 15 figures