基于掩码自动编码器自监督预训练提升合成孪像图像目标检测
计算机视觉与模式识别
2025-01-22 v1
摘要
监督式微调(SFT)方法在人工智能合成孪像图像解释中表现出色,利用来自预训练模型的强大表示知识。由于缺乏针对合成孪像图像的领域特定预训练主干网络,传统策略会加载自然场景如 ImageNet 的基础预训练模型,其图像特征与合成孪像图像截然不同。这可能阻碍在小规模标注合成孪像数据上采用 SFT 时模型性能。本文提出了一种基于掩码自动编码器(Masked Auto-Encoder, MAE) 的自监督学习(SSL) 方法,用于在预训练过程中学习合成孪像图像的特征表示,并为 SFT 的合成孪像图像目标检测任务提供支持。在名为 SARDet-100k 的大规模合成孪像目标检测基准测试上进行评估实验验证,我们的方法能够捕获合成孪像图像的恰当隐含表示,通过 SSL 将预训练领域从自然场景转换到合成孪像图像,从而提高下游任务的模型泛化能力。该方法在 SARDet-100k 基准测试上相较于仅采用 SFT 策略实现了 1.3 mAP 的提升。
引用
@article{arxiv.2501.11249,
title = {Enhancing SAR Object Detection with Self-Supervised Pre-training on Masked Auto-Encoders},
author = {Xinyang Pu and Feng Xu},
journal= {arXiv preprint arXiv:2501.11249},
year = {2025}
}