IG Captioner:信息增益描述器是强零样本分类器
计算机视觉与模式识别
2024-07-18 v2 人工智能
机器学习
多媒体
摘要
生成式训练已被证明对构建视觉-语言模型十分有效。然而,在零样本判别基准上,以生成式和判别式目标训练的模型间仍存在性能差距。本文旨在缩小该差距,通过提升生成式训练在分类任务上的效能,且无需任何微调过程或附加模块。具体而言,我们聚焦于缩小生成式描述器与 CLIP 分类器间的差距。我们首先分析描述器与分类器的预测,观察到描述生成从纯文本模态训练的语言模型继承了分布偏置,使其较少 grounding 于视觉信号。为解决此问题,我们重新设计描述器的评分目标以缓解分布偏置,并聚焦于度量视觉输入所带来的信息增益。我们进一步设计生成式训练目标以匹配评估目标。我们将以新流程训练和评估的模型命名为信息增益(IG)描述器。我们在公开 Laion-5B 数据集上预训练模型并进行一系列判别评估。在 ImageNet 零样本分类上,IG 描述器较标准描述器提升 >18%,取得与 CLIP 分类器相当的性能。IG 描述器在 MSCOCO 与 Flickr30K 的零样本图像-文本检索任务上也展现出强性能。我们希望本文能启发进一步研究,以统一视觉-语言模型的生成式与判别式训练流程。
引用
@article{arxiv.2311.17072,
title = {IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers},
author = {Chenglin Yang and Siyuan Qiao and Yuan Cao and Yu Zhang and Tao Zhu and Alan Yuille and Jiahui Yu},
journal= {arXiv preprint arXiv:2311.17072},
year = {2024}
}
备注
To appear in ECCV 2024