中文

MoDE:通过聚类实现的CLIP数据专家

计算机视觉与模式识别 2024-04-25 v1 人工智能 计算与语言 机器学习

摘要

对比语言-图像预训练(CLIP)的成功依赖于图像与标题之间的配对监督,而在网络爬取的数据中这种配对往往存在噪声。我们提出了数据专家混合模型(MoDE),并通过聚类学习一个CLIP数据专家系统。每个数据专家在一个数据聚类上训练,对其他聚类中的假负噪声不那么敏感。在推理时,我们通过任务元数据与聚类条件之间的相关性确定权重,对它们的输出进行集成。为了精确估计相关性,一个聚类中的样本应在语义上相似,但数据专家的数量仍需合理以支持训练和推理。因此,我们考虑人类语言中的本体论,提出使用细粒度聚类中心在粗粒度层面上表示每个数据专家。实验研究表明,在ViT-B/16上的四个CLIP数据专家在零样本图像分类上优于OpenAI CLIP和OpenCLIP的ViT-L/14,但训练成本更低(<35%)。同时,MoDE可以异步训练所有数据专家,并灵活地加入新的数据专家。代码可在https://github.com/facebookresearch/MetaCLIP/tree/main/mode获取。

关键词

引用

@article{arxiv.2404.16030,
  title  = {MoDE: CLIP Data Experts via Clustering},
  author = {Jiawei Ma and Po-Yao Huang and Saining Xie and Shang-Wen Li and Luke Zettlemoyer and Shih-Fu Chang and Wen-Tau Yih and Hu Xu},
  journal= {arXiv preprint arXiv:2404.16030},
  year   = {2024}
}

备注

IEEE CVPR 2024 Camera Ready. Code Link: https://github.com/facebookresearch/MetaCLIP/tree/main/mode