中文

基于高清X射线图像的预训练:一项实验研究

图像与视频处理 2024-04-30 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

现有的基于 X 射线的预训练视觉模型通常是在相对小规模的数据集(少于 50 万样本)和有限分辨率(例如 224 × 224)上进行的。然而,自监督预训练大模型成功的关键在于海量的训练数据,而在 X 射线图像领域保持高分辨率是有效解决疑难杂症的保证。在本文中,我们通过在我们新收集的包含超过 100 万张 X 射线图像的大规模数据集上提出第一个高清(1280 × 1280)X 射线基础视觉模型来解决这些问题。我们的模型遵循掩码自编码器框架,该框架将经过掩码处理(高掩码率)后的令牌作为输入,并通过 Transformer 编码器-解码器网络重建被掩码的图像块。更重要的是,我们引入了一种新颖的上下文感知掩码策略,该策略利用胸部轮廓作为自适应掩码操作的边界。我们在两个下游任务上验证了我们模型的有效性,包括 X 射线报告生成和疾病识别。大量实验表明,我们预训练的医学基础视觉模型在下游基准数据集上达到了可比较甚至是最新的性能。本文的源代码和预训练模型将在 https://github.com/Event-AHU/Medical_Image_Analysis 上发布。

关键词

引用

@article{arxiv.2404.17926,
  title  = {Pre-training on High Definition X-ray Images: An Experimental Study},
  author = {Xiao Wang and Yuehang Li and Wentao Wu and Jiandong Jin and Yao Rong and Bo Jiang and Chuanfu Li and Jin Tang},
  journal= {arXiv preprint arXiv:2404.17926},
  year   = {2024}
}

备注

Technology Report