中文

MedDChest:面向胸部成像的内容感知多模态基础视觉模型

计算机视觉与模式识别 2025-11-07 v1

摘要

医学影像中视觉模型的性能常受限于以自然图像为预训练来源的微调主干模型范式。为解决这一根本性领域差距,我们提出 MedDChest,一个新的针对胸部成像优化的基础视觉转换器(Vision Transformer, ViT)模型。我们从零在由 10 个公开数据源 compilation 而成的包含 120 万张以上图像的大型、精选的多模态数据集上进行预训练,涵盖不同的成像模态,包括胸片和计算机断层扫描(CT)。本工作的核心技术贡献是引导式随机缩放裁切(Guided Random Resized Crops),这是一种新颖的内容感知数据增强策略,通过偏向抽样解剖相关区域,克服了标准裁切技术在医学扫描中的低效问题。我们通过在多样化的下游诊断任务上进行微调来验证模型的有效性。全面实验经验表明,MedDChest 显著优于强大的公开可用的 ImageNet 预训练模型。通过建立大规模、领域内预训练结合领域特定数据增强的优势,MedDChest 提供了一个强大且稳健的特征提取器,为广泛的胸部诊断任务提供了显著更好的起点。该模型权重将公开,以促进未来的研究和应用。

关键词

引用

@article{arxiv.2511.04016,
  title  = {MedDChest: A Content-Aware Multimodal Foundational Vision Model for Thoracic Imaging},
  author = {Mahmoud Soliman and Islam Osman and Mohamed S. Shehata and Rasika Rajapakshe},
  journal= {arXiv preprint arXiv:2511.04016},
  year   = {2025}
}

备注

10 pages, 2 figures