中文

面向自监督学习的物体感知裁剪

计算机视觉与模式识别 2023-04-10 v2 机器学习

摘要

近期自监督学习取得成功的一个核心组件是裁剪数据增强,它选择图像的子区域作为自监督损失中的正视图。其潜在假设是,给定图像的随机裁剪和缩放区域共享关于感兴趣物体的信息,所学表征将捕获这些信息。这一假设在 ImageNet 等数据集中基本成立,其中存在一个居中的大型物体,极有可能出现在完整图像的随机裁剪中。然而,在 OpenImages 或 COCO 等更具真实世界未筛选数据代表性的其他数据集中,图像中通常存在多个小物体。在这项工作中,我们表明基于通常随机裁剪的自监督学习在此类数据集上表现不佳。我们提出用从物体提议算法获得的裁剪替换一个或两个随机裁剪。这鼓励模型学习物体级和场景级语义表征。使用这一我们称之为物体感知裁剪的方法,在分类和物体检测基准上相比场景裁剪取得了显著改进。例如,在 OpenImages 上,我们的方法在使用基于 MoCo-v2 的预训练时,相比随机场景级裁剪实现了 8.8% mAP 的提升。我们还展示了在 COCO 和 PASCAL-VOC 物体检测与分割任务上相比最先进的自监督学习方法有显著改进。我们的方法高效、简单且通用,可用于大多数现有的对比与非对比自监督学习框架。

关键词

引用

@article{arxiv.2112.00319,
  title  = {Object-Aware Cropping for Self-Supervised Learning},
  author = {Shlok Mishra and Anshul Shah and Ankan Bansal and Abhyuday Jagannatha and Janit Anjaria and Abhishek Sharma and David Jacobs and Dilip Krishnan},
  journal= {arXiv preprint arXiv:2112.00319},
  year   = {2023}
}