无需额外训练即适配CLIP进行短语定位
计算机视觉与模式识别
2022-04-08 v1 人工智能
摘要
有监督或弱监督的短语定位(文本定位)方法要么依赖人工标注,要么依赖其他有监督模型,如目标检测器。获取这些标注劳动密集,且在实践中难以扩展。我们提出利用对比语言-视觉模型CLIP的最新进展,该模型在从互联网收集的图像-标题对上预训练。在其原始形式中,CLIP仅输出图像级嵌入,没有任何空间分辨率。我们适配CLIP以生成高分辨率空间特征图。重要的是,我们可以从ViT和ResNet CLIP模型中提取特征图,同时保持图像嵌入的语义属性。这为短语定位提供了一个自然的框架。我们的短语定位方法无需任何人工标注或额外训练。大量实验表明,我们的方法在零样本短语定位中优于现有的无训练方法,在某些情况下甚至优于有监督方法。代码见https://github.com/pals-ttic/adapting-CLIP。
引用
@article{arxiv.2204.03647,
title = {Adapting CLIP For Phrase Localization Without Further Training},
author = {Jiahao Li and Greg Shakhnarovich and Raymond A. Yeh},
journal= {arXiv preprint arXiv:2204.03647},
year = {2022}
}