CLIP 模型是少样本学习器:VQA 与视觉蕴涵的实证研究
计算机视觉与模式识别
2022-03-15 v1 计算与语言
摘要
CLIP 在广泛视觉任务上展现了卓越的零样本能力。此前,CLIP 仅被视为一个强大的视觉编码器。然而,在经过大量图像-描述对的语言监督预训练后,CLIP 本身也应已习得一些面向视觉-语言任务的少样本能力。本工作中,我们通过利用语言的力量实证表明 CLIP 可成为一个强视觉-语言少样本学习器。我们首先评估 CLIP 在典型视觉问答任务上的零样本性能,并展示 CLIP 在视觉蕴涵任务上的零样本跨模态迁移能力。随后我们提出一种参数高效微调策略以提升在 VQA 任务上的少样本性能。我们在视觉问答与视觉蕴涵任务上取得了具竞争力的零/少样本结果,且未引入任何额外预训练过程。
引用
@article{arxiv.2203.07190,
title = {CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment},
author = {Haoyu Song and Li Dong and Wei-Nan Zhang and Ting Liu and Furu Wei},
journal= {arXiv preprint arXiv:2203.07190},
year = {2022}
}
备注
ACL 2022 main conference