中文

聚焦纹理:基于掩码自编码器的医学图像分类预训练框架

图像与视频处理 2025-07-16 v1 计算机视觉与模式识别

摘要

掩码自编码器 (MAEs) 已成为自然图像上自监督表示学习的主导策略,其中模型被预训练以重建被掩码的图像块,采用像素级均方误差 (MSE) 作为原始与重建 RGB 值之间的损失。我们注意到 MSE 鼓励模糊图像重建,但仍可用于自然图像,因为它保留了主导边缘。然而,在医学成像中,当纹理线索对于视觉异常的分类更重要时,该策略会失败。着眼于放射组学研究中 Gray Level Co-occurrence Matrix (GLCM) 的特征,我们提出了一种新的 MAE 基于预训练框架,GLCM-MAE,采用基于匹配 GLCM 的重建损失。GLCM 捕获图像中强度和空间关系,因此提出的损失有助于保留形态特征。进一步,我们提出了将匹配 GLCM 矩阵转换为可微分损失函数的新方法。我们展示了使用所提 GLCM 损失对医学图像进行无监督预训练可提高下游任务的表示。GLCM-MAE 在四个任务中超过当前最先进技术——通过超声图像检测 gallbladder 癌症提高 2.1%,通过超声图像检测乳腺癌提高 3.1%,通过 x 光图像检测肺炎提高 0.5%,通过 CT 扫描检测 COVID 提高 0.6%。源代码和预训练模型均可用:https://github.com/ChetanMadan/GLCM-MAE。

关键词

引用

@article{arxiv.2507.10869,
  title  = {Focus on Texture: Rethinking Pre-training in Masked Autoencoders for Medical Image Classification},
  author = {Chetan Madan and Aarjav Satia and Soumen Basu and Pankaj Gupta and Usha Dutta and Chetan Arora},
  journal= {arXiv preprint arXiv:2507.10869},
  year   = {2025}
}

备注

To appear at MICCAI 2025