中文

基于掩码自动编码器自监督预训练提升合成孪像图像目标检测

计算机视觉与模式识别 2025-01-22 v1

摘要

监督式微调(SFT)方法在人工智能合成孪像图像解释中表现出色,利用来自预训练模型的强大表示知识。由于缺乏针对合成孪像图像的领域特定预训练主干网络,传统策略会加载自然场景如 ImageNet 的基础预训练模型,其图像特征与合成孪像图像截然不同。这可能阻碍在小规模标注合成孪像数据上采用 SFT 时模型性能。本文提出了一种基于掩码自动编码器(Masked Auto-Encoder, MAE) 的自监督学习(SSL) 方法,用于在预训练过程中学习合成孪像图像的特征表示,并为 SFT 的合成孪像图像目标检测任务提供支持。在名为 SARDet-100k 的大规模合成孪像目标检测基准测试上进行评估实验验证,我们的方法能够捕获合成孪像图像的恰当隐含表示,通过 SSL 将预训练领域从自然场景转换到合成孪像图像,从而提高下游任务的模型泛化能力。该方法在 SARDet-100k 基准测试上相较于仅采用 SFT 策略实现了 1.3 mAP 的提升。

关键词

引用

@article{arxiv.2501.11249,
  title  = {Enhancing SAR Object Detection with Self-Supervised Pre-training on Masked Auto-Encoders},
  author = {Xinyang Pu and Feng Xu},
  journal= {arXiv preprint arXiv:2501.11249},
  year   = {2025}
}