中文

小对象图像的掩码策略

计算机视觉与模式识别 2026-02-10 v1 图像与视频处理

摘要

用于检测和分类小血液成分的血液学分析是重要挑战。特别是在大背景中存在大量小尺寸对象的情形。深度学习方法使用预训练权重的监督模型(如残差网络和视觉转换器)在许多应用中已显示成功。然而,当应用于学习表示之外的图像时,这些方法常导致性能不足。可以通过使用自监督模型来克服这一点,其中学习到的表示随后用于下游应用。在最近的研究中,掩码自编码器(MAE)被证明有效,可获取捕获全局上下文信息的表示。通过对图像的某些区域进行掩码处理,模型学习重建被掩码和非掩码区域的图像,随后可用于各种应用。然而,如果图像中对象的尺寸小于掩码的尺寸,则会丢失全局上下文信息,几乎不可能重建图像。本研究考察了掩码比例和 patch 大小对血液成分的影响,使用 MAE 获取学习到的 ViT 编码器表示。随后,我们将编码器权重用于训练 U-Net Transformer 进行语义分割,以获得局部和全局上下文信息。我们的实验结果表明,较小的掩码比例和 patch 大小可提高使用 MAE 的图像重建质量。我们还展示了带和不使用预训练权重的语义分割结果,小尺寸血液成分受益于预训练。总体而言,我们提出的方法为小对象分割和分类提供了一种高效且有效的策略。

关键词

引用

@article{arxiv.2504.17935,
  title  = {Masked strategies for images with small objects},
  author = {H. Martin Gillis and Ming Hill and Paul Hollensen and Alan Fine and Thomas Trappenberg},
  journal= {arXiv preprint arXiv:2504.17935},
  year   = {2026}
}