AutoCLIP:视觉-语言模型的零样本分类器自动调优
计算机视觉与模式识别
2024-08-15 v3 人工智能
机器学习
摘要
基于 CLIP 等视觉-语言模型构建的分类器在广泛的图像分类任务中展现了卓越的零样本性能。已有研究探讨了基于提示模板为每类自动创建描述符集的不同方式,从人工设计的模板、由大语言模型获得的模板,到由随机词与字符构建的模板。迄今为止,从相应编码的类描述符导出零样本分类器的方式几乎未变,即分类到其平均编码类描述符与图像编码间余弦相似度最大的类。然而,当某些描述符比其它描述符更好地匹配给定图像上的视觉线索时,平等权衡所有类描述符可能是次优的。在本工作中,我们提出 AutoCLIP,一种用于自动调优零样本分类器的方法。AutoCLIP 在推理时基于类描述符-图像相似度的统计量为每个提示模板调整逐图像权重。AutoCLIP 完全无监督,仅带来微小的额外计算开销,且可用几行代码轻松实现。我们表明 AutoCLIP 在广泛的视觉-语言模型、数据集与提示模板上一致地优于基线,准确率提升最高达 3 个百分点。
引用
@article{arxiv.2309.16414,
title = {AutoCLIP: Auto-tuning Zero-Shot Classifiers for Vision-Language Models},
author = {Jan Hendrik Metzen and Piyapat Saranrittichai and Chaithanya Kumar Mummadi},
journal= {arXiv preprint arXiv:2309.16414},
year = {2024}
}
备注
accepted at TMLR, Camera Ready Version