对比特征掩码开放词汇视觉Transformer
计算机视觉与模式识别
2023-09-06 v1 人工智能
机器学习
摘要
我们提出对比特征掩码视觉Transformer(CFM-ViT)——一种图像-文本预训练方法,可同时学习图像级与区域级表征,用于开放词汇目标检测(OVD)。我们的方法将掩码自编码器(MAE)目标与对比学习目标相结合,以改善用于定位任务的表征。与标准MAE不同,我们在联合图像-文本嵌入空间中进行重建,而非如经典MAE方法惯例那样在像素空间中进行,这使模型能更好地学习区域级语义。此外,我们引入位置嵌入丢弃(PED),通过在预训练期间随机丢弃位置嵌入来解决图像-文本预训练与检测微调之间的尺度差异。PED提升了检测性能,并使得可使用冻结的ViT骨干作为区域分类器,防止在检测微调期间遗忘开放词汇知识。在LVIS开放词汇检测基准上,CFM-ViT取得了33.9 AP的当前最佳成绩,超越最佳方法7.6个点,并实现了更好的零样本检测迁移。最后,CFM-ViT获得了强大的图像级表征,在零样本图像-文本检索基准的12项指标中有8项优于当前最佳。
引用
@article{arxiv.2309.00775,
title = {Contrastive Feature Masking Open-Vocabulary Vision Transformer},
author = {Dahun Kim and Anelia Angelova and Weicheng Kuo},
journal= {arXiv preprint arXiv:2309.00775},
year = {2023}
}
备注
Accepted to ICCV 2023