基于引导裁剪的零样本视觉分类
计算机视觉与模式识别
2023-09-14 v1
摘要
预训练的视觉-语言模型,如 CLIP,在多种数据集上展现出有前景的零样本性能。然而,对于闭集分类任务,存在一个固有局限:CLIP 图像编码器通常设计用于提取概括目标任务中多余或混淆信息的通用图像级特征。这导致分类性能下降,尤其是当感兴趣物体仅覆盖输入图像的小区域时。在本工作中,我们提出带引导裁剪的 CLIP(GC-CLIP),其中我们在预处理步骤中使用一个现成的零样本目标检测模型,以增强零样本分类器对感兴趣物体的关注,并最小化无关图像区域的影响。我们通过实验表明,我们的方法在不同架构与数据集上改善了零样本分类结果,对小物体尤为有利。
引用
@article{arxiv.2309.06581,
title = {Zero-Shot Visual Classification with Guided Cropping},
author = {Piyapat Saranrittichai and Mauricio Munoz and Volker Fischer and Chaithanya Kumar Mummadi},
journal= {arXiv preprint arXiv:2309.06581},
year = {2023}
}