前缀条件化统一语言与标签监督
计算机视觉与模式识别
2023-05-17 v2
摘要
图像分类数据集已被用于预训练图像识别模型。近来,网络规模的图文数据集已成为一种强有力的预训练替代来源。图文数据集更为“开放域”,包含比传统分类数据集更多样的场景类型与词汇,且在这些数据集上训练的模型在少样本与零样本识别任务中展现出强劲性能。当朴素地统一图像分类与图文数据集时,我们表明此类数据集偏置会通过降低所学表征的泛化性而负面影响预训练,并因而危及零样本性能,因为该统一可使模型迎合分类数据集,使其易受来自该数据集的分布偏移影响。本工作中,我们通过使用前缀 token 在训练时告知语言编码器输入数据集的类型(如图像分类或图文)来解耦数据集偏置。该方法允许语言编码器共享两数据集的知识并切换特征提取模式(即面向图像分类数据集或图文数据集的定制模式),其中我们在零样本评估中使用图文模式。我们的方法具有通用性,可轻松集成到现有 VL 预训练目标(如 CLIP 或 UniCL)中。实验中,我们表明这一简单技术提升了零样本图像识别准确率及对图像级分布偏移的鲁棒性。
引用
@article{arxiv.2206.01125,
title = {Prefix Conditioning Unifies Language and Label Supervision},
author = {Kuniaki Saito and Kihyuk Sohn and Xiang Zhang and Chun-Liang Li and Chen-Yu Lee and Kate Saenko and Tomas Pfister},
journal= {arXiv preprint arXiv:2206.01125},
year = {2023}
}
备注
CVPR2023