中文

S-CLIP:利用少量专家描述进行半监督视觉-语言学习

计算机视觉与模式识别 2023-10-26 v2 机器学习

摘要

视觉-语言模型,如对比语言-图像预训练(CLIP),已在自然图像领域展现出令人印象深刻的成果。然而,这些模型在应用于遥感等专门领域时常常表现不佳,且由于可用于训练的图文对数量有限,适应此类领域颇具挑战。为此,我们提出 S-CLIP,一种利用额外无配对图像训练 CLIP 的半监督学习方法。S-CLIP 采用两种专为对比学习与语言模态设计的伪标签策略。描述级伪标签由配对图像的描述组合给出,通过求解无配对与配对图像之间的最优传输问题获得。关键词级伪标签由最近配对图像描述中的一个关键词给出,通过部分标签学习训练,该方法假设一组候选标签用于监督而非精确标签。通过结合这些目标,S-CLIP 仅使用少量图文对便显著增强了 CLIP 的训练,如遥感、时尚、科学图示与漫画等多个专门领域所示。例如,S-CLIP 在遥感基准上将 CLIP 的零样本分类提升 10%、图文检索提升 4%,在使用少三倍图文对的情况下匹配了有监督 CLIP 的性能。

关键词

引用

@article{arxiv.2305.14095,
  title  = {S-CLIP: Semi-supervised Vision-Language Learning using Few Specialist Captions},
  author = {Sangwoo Mo and Minkyu Kim and Kyungmin Lee and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2305.14095},
  year   = {2023}
}

备注

NeurIPS 2023