面向开放词汇检测以区域为中心的图像-语言预训练
计算机视觉与模式识别
2024-07-22 v2 人工智能
机器学习
摘要
我们提出一种基于以区域为中心的图像-语言预训练的开放词汇检测新方法,以弥合图像级预训练与开放词汇目标检测之间的差距。在预训练阶段,我们在分类骨干网络之上接入检测器架构,使检测头能从大规模图文对中学习,从而更好地满足检测的区域级识别需求。仅使用标准对比损失而无伪标注,我们的方法是对比学习方法的一个简单而有效的扩展,可学习涌现的物体-语义线索。此外,我们提出一种基于窗口注意力的偏移窗口学习方法,使骨干表示更鲁棒、平移不变,且更少受窗口模式偏置。在流行的 LVIS 开放词汇检测基准上,我们的方法以常用 ViT-L 骨干和公开 LAION 数据集取得了 37.6 mask APr 的新最优结果,使用 DataComp-1B 数据集时达 40.5 mask APr,在系统层面以 +3.7 mask APr 显著优于现有最佳方法。在 COCO 基准上,我们无需伪标注或弱监督即取得极具竞争力的 39.6 novel AP。此外,我们在迁移检测设定下评估了我们的方法,其较基线有显著提升。可视化显示,与基线相比,预训练方案涌现出物体定位能力。
引用
@article{arxiv.2310.00161,
title = {Region-centric Image-Language Pretraining for Open-Vocabulary Detection},
author = {Dahun Kim and Anelia Angelova and Weicheng Kuo},
journal= {arXiv preprint arXiv:2310.00161},
year = {2024}
}
备注
ECCV 2024, project page at https://github.com/google-research/google-research/tree/master/fvlm/dito