用于视觉Transformer开放词汇目标检测的区域感知预训练
计算机视觉与模式识别
2023-08-29 v4 人工智能
计算与语言
摘要
我们提出区域感知开放词汇视觉Transformer(RO-ViT)——一种对比图像-文本预训练方法,以弥合图像级预训练与开放词汇目标检测之间的差距。在预训练阶段,我们提出随机裁剪并缩放位置嵌入的区域,而非使用整图位置嵌入。这更好地匹配了检测微调阶段在区域级使用位置嵌入的方式。此外,我们将对比学习中常用的softmax交叉熵损失替换为focal loss,以更好地学习信息量大却困难的样本。最后,我们利用新颖目标提议的最新进展来改进开放词汇检测微调。我们在LVIS和COCO开放词汇检测基准及零样本迁移上评估了我们的完整模型。RO-ViT在LVIS上取得了34.1 的state-of-the-art成绩,比现有最佳方法高出+7.8点,同时在零样本迁移检测上也具竞争力。令人惊讶的是,RO-ViT也改善了图像级表征,在COCO和Flickr图像-文本检索基准的12项指标中有9项取得state of the art,优于参数量更大的竞争方法。
引用
@article{arxiv.2305.07011,
title = {Region-Aware Pretraining for Open-Vocabulary Object Detection with Vision Transformers},
author = {Dahun Kim and Anelia Angelova and Weicheng Kuo},
journal= {arXiv preprint arXiv:2305.07011},
year = {2023}
}
备注
CVPR 2023 Highlight - https://github.com/mcahny/rovit ; adds LAION-2B result