CLIP 能为视觉与语言任务带来多大增益?
计算机视觉与模式识别
2021-07-15 v1 人工智能
计算与语言
机器学习
摘要
大多数现有视觉与语言(V&L)模型依赖预训练的视觉编码器,使用相对少量的手动标注数据(相较于网络爬取数据)来感知视觉世界。然而,已观察到大规模预训练通常能带来更好的泛化性能,例如 CLIP(Contrastive Language-Image Pre-training,对比语言-图像预训练)在海量图像-描述对上训练,已在各种视觉任务上展现出强大的零样本能力。为进一步研究 CLIP 带来的优势,我们提出在多种 V&L 模型中使用 CLIP 作为视觉编码器,涵盖两种典型场景:1)将 CLIP 接入任务特定微调;2)将 CLIP 与 V&L 预训练结合并迁移至下游任务。我们表明 CLIP 显著优于广泛使用的、在域内标注数据上训练的视觉编码器,如 BottomUp-TopDown。我们在多种 V&L 任务上取得了有竞争力或更好的结果,同时在视觉问答、视觉蕴含和 V&L 导航任务上确立了新的 SOTA 结果。我们在 https://github.com/clip-vil/CLIP-ViL 发布了代码。
引用
@article{arxiv.2107.06383,
title = {How Much Can CLIP Benefit Vision-and-Language Tasks?},
author = {Sheng Shen and Liunian Harold Li and Hao Tan and Mohit Bansal and Anna Rohrbach and Kai-Wei Chang and Zhewei Yao and Kurt Keutzer},
journal= {arXiv preprint arXiv:2107.06383},
year = {2021}
}
备注
14 pages