中文

UniCLIP:对比语言-图像预训练的统一框架

计算机视觉与模式识别 2022-11-01 v2 机器学习

摘要

以对比目标预训练视觉-语言模型已展现出可扩展至大型未整理数据集且可迁移至许多下游应用的有前景结果。一些后续工作旨在通过添加自监督项来提高数据效率,但那些工作中的域间(图像-文本)对比损失与域内(图像-图像)对比损失定义于各自独立空间,因此许多可行的监督组合被忽视。为克服此问题,我们提出 UniCLIP,一种用于对比语言-图像预训练的统一框架。UniCLIP 将域间对与域内对的对比损失整合到单一通用空间中。整合不同域间对比损失时出现的差异由 UniCLIP 的三个关键组件解决:(1)增强感知特征嵌入,(2)MP-NCE 损失,以及(3)依赖于域的相似度度量。UniCLIP 在各种单模态与多模态下游任务上优于先前的视觉-语言预训练方法。在我们的实验中,我们表明构成 UniCLIP 的每个组件都对最终性能有良好的贡献。

关键词

引用

@article{arxiv.2209.13430,
  title  = {UniCLIP: Unified Framework for Contrastive Language-Image Pre-training},
  author = {Janghyeon Lee and Jongsuk Kim and Hyounguk Shon and Bumsoo Kim and Seung Hwan Kim and Honglak Lee and Junmo Kim},
  journal= {arXiv preprint arXiv:2209.13430},
  year   = {2022}
}

备注

Neural Information Processing Systems (NeurIPS) 2022