基于 Transformer 的目标检测自监督学习方法的实证研究
计算机视觉与模式识别
2022-05-12 v1 人工智能
机器学习
摘要
自监督学习 (SSL) 方法(如掩码语言建模)通过对 transformer 模型进行预训练,已在多种自然语言处理任务中展现出巨大的性能提升。后续研究将类似方法(如视觉 transformer 中的掩码图像建模)进行适配,并展示了在图像分类任务中的改进。此类简单的自监督方法尚未在目标检测 transformer(DETR、Deformable DETR)中得到详尽研究,因为其 transformer 编码器模块以卷积神经网络 (CNN) 提取的特征空间而非通用视觉 transformer 中的图像空间作为输入。然而,CNN 特征图仍保持空间关系,我们利用该性质设计了自监督学习方法,在预训练和多任务学习设置下训练目标检测 transformer 的编码器。我们探索了基于图像重建、掩码图像建模和拼图的常见自监督方法。在 iSAID 数据集上的初步实验表明,DETR 在预训练和多任务学习设置下的初始轮次均收敛更快;然而,在 Deformable DETR 的多任务学习中未观察到类似改进。我们针对 DETR 和 Deformable DETR 的实验代码分别位于 https://github.com/gokulkarthik/detr 和 https://github.com/gokulkarthik/Deformable-DETR。
引用
@article{arxiv.2205.05543,
title = {An Empirical Study Of Self-supervised Learning Approaches For Object Detection With Transformers},
author = {Gokul Karthik Kumar and Sahal Shaji Mullappilly and Abhishek Singh Gehlot},
journal= {arXiv preprint arXiv:2205.05543},
year = {2022}
}
备注
Final Project for the course "Visual Object Detection And Recognition" (CV703) at MBZUAI