中文

掩蔽分层特征用于自监督学习

计算机视觉与模式识别 2023-04-04 v1 人工智能

摘要

本文表明,掩蔽深度分层特征是一种高效的自监督方法,记为MaskDeep。MaskDeep将表示空间中的每个图像块视为独立实例。我们掩蔽表示空间中的部分图像块,然后利用稀疏可见图像块重建高语义图像表示。MaskDeep的直觉在于模型可从稀疏可见图像块的语义推理出图像的全局语义。我们进一步在框架中提出三项设计:1)分层深度掩蔽模块以关注图像块表示的分层特性,2)多组策略在不增加编码器任何额外计算消耗的情况下提高效率,3)多目标策略以提供对全局语义的更多描述。我们的MaskDeep带来了可观提升。在ResNet50上训练200轮,MaskDeep在ImageNet上取得71.2% Top1准确率线性分类的当前最佳结果。在COCO目标检测任务上,MaskDeep优于专为目标检测设计的自监督方法SoCo。当训练100轮时,MaskDeep取得69.6% Top1准确率,超越当前训练200轮的方法如HCSC达0.4%。

关键词

引用

@article{arxiv.2304.00218,
  title  = {Mask Hierarchical Features For Self-Supervised Learning},
  author = {Fenggang Liu and Yangguang Li and Feng Liang and Jilan Xu and Bin Huang and Jing Shao},
  journal= {arXiv preprint arXiv:2304.00218},
  year   = {2023}
}