面向胸片的医学视觉语言预训练统一基准框架 BenchX
计算机视觉与模式识别
2024-10-30 v1
摘要
医学视觉语言预训练(MedVLP)在从配对和非配对医学图像和报告中学习通用且可迁移的视觉表征方面显示出前景。MedVLP 可为下游任务提供有用特征,促进使用更少样本即可将任务特定模型适应到新环境。然而,现有 MedVLP 方法在数据集、预处理和微调实现方面存在差异。这给评估 MedVLP 方法如何针对各种临床相关任务进行泛化带来了很大挑战,due to缺乏统一、标准化和全面的基准。为填补这一空白,我们提出了 BenchX,一个统一的基准框架,使其能够使用公共胸片 X 光数据集进行 Head-to-Head 比较和系统化分析。具体而言,BenchX 由三个组件构成:1)覆盖九个数据集和四个医学任务的全面数据集;2)用于标准化数据预处理、训练-测试划分和参数选择的基准套件;3)适用于分类、分割和报告生成的统一微调协议。利用 BenchX,我们为九个最先进的 MedVLP 方法建立了基线,并发现某些早期 MedVLP 方法的性能可提升至超过后续方法,这促使我们重新审视 MedVLP 领域的发展历程和先前工作的结论。我们的代码已公开于 https://github.com/yangzhou12/BenchX。
引用
@article{arxiv.2410.21969,
title = {BenchX: A Unified Benchmark Framework for Medical Vision-Language Pretraining on Chest X-Rays},
author = {Yang Zhou and Tan Li Hui Faith and Yanyu Xu and Sicong Leng and Xinxing Xu and Yong Liu and Rick Siow Mong Goh},
journal= {arXiv preprint arXiv:2410.21969},
year = {2024}
}
备注
Accepted to NeurIPS24 Datasets and Benchmarks Track