基准测试 CXR 基础模型:基于公开 MIMIC-CXR 和 NIH-CXR14 数据集
计算机视觉与模式识别
2025-12-09 v1
摘要
近期基础模型在医学图像表征学习方面显示出强大的性能,但其在不同数据集上的比较行为仍未得到充分探索。本工作对两种大规模胸腔 X 光(CXR)嵌入模型(CXR-Foundation(ELIXR v2.0)和 MedImagelnsight)在公开 MIMIC-CR 和 NIH ChestX-ray14 数据集上的基准测试进行了评估。每种模型均采用统一的预处理流程和固定的下游分类器进行评估,以确保可重复的比较。我们直接从预训练编码器中提取嵌入,在多个疾病标签上训练轻量级 LightGBM 分类器,并报告平均 AUROC 和 F1 分数,附带 95% 置信区间。MedImageInsight 在大多数任务上实现了略高的性能,而 CXR-Foundation 表现出强大的跨数据集稳定性。对 MedImageInsight 嵌入进行的无监督聚类进一步揭示了与定量结果一致的连贯的疾病特定结构。结果凸显了对医学基础模型进行标准化评估的必要性,并为未来多模态和临床集成研究建立了可重复的基准。
引用
@article{arxiv.2512.06014,
title = {Benchmarking CXR Foundation Models With Publicly Available MIMIC-CXR and NIH-CXR14 Datasets},
author = {Jiho Shin and Dominic Marshall and Matthieu Komorowski},
journal= {arXiv preprint arXiv:2512.06014},
year = {2025}
}