中文

HASSOD:分层自适应自监督目标检测

计算机视觉与模式识别 2024-02-06 v1 人工智能 机器学习

摘要

人类视觉感知系统在没有显式监督的情况下学习以及理解物体的部分到整体组成方面表现出卓越的能力。受这两种能力的启发,我们提出了分层自适应自监督目标检测(HASSOD),这是一种无需人类监督即可学习检测物体并理解其组成的新方法。HASSOD 采用分层自适应聚类策略,基于自监督视觉表示将区域分组为物体掩码,并自适应地确定每张图像中的物体数量。此外,HASSOD 通过分析掩码之间的覆盖关系并构建树结构,来识别物体在组成方面的层级。这个额外的自监督学习任务带来了检测性能的提升和可解释性的增强。最后,我们摒弃了先前方法中使用的低效多轮自训练过程,转而采用半监督学习中的 Mean Teacher 框架,从而实现了更平滑、更高效的训练过程。通过在主流图像数据集上的大量实验,我们证明了 HASSOD 相对于现有方法的优越性,从而推动了自监督目标检测领域的最新技术水平。值得注意的是,我们在 LVIS 上将 Mask AR 从 20.2 提升到 22.5,在 SA-1B 上从 17.0 提升到 26.0。项目页面:https://HASSOD-NeurIPS23.github.io。

关键词

引用

@article{arxiv.2402.03311,
  title  = {HASSOD: Hierarchical Adaptive Self-Supervised Object Detection},
  author = {Shengcao Cao and Dhiraj Joshi and Liang-Yan Gui and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2402.03311},
  year   = {2024}
}

备注

NeurIPS 2023