中文

视觉-语言预训练中分类的正确实现

计算机视觉与模式识别 2024-11-07 v2

摘要

我们引入了 SuperClass,一种用于图像-文本数据视觉-语言预训练的极简分类方法。与其对比学习对应方法 CLIP 通过与文本编码器进行对比不同,SuperClass 直接利用分词后的原始文本作为监督分类标签,无需额外的文本过滤或选择。由于不存在作为对比目标的文本编码,SuperClass 不需要文本编码器,也不需要像 CLIP 那样维持大批量大小。SuperClass 在各种下游任务中展现出卓越性能,包括经典计算机视觉基准和视觉语言下游任务。我们进一步探索了 SuperClass 在模型大小、训练长度或数据规模上的缩放行为,并报告了令人鼓舞的结果及与 CLIP 的比较。https://github.com/x-cls/superclass

关键词

引用

@article{arxiv.2411.03313,
  title  = {Classification Done Right for Vision-Language Pre-Training},
  author = {Zilong Huang and Qinghao Ye and Bingyi Kang and Jiashi Feng and Haoqi Fan},
  journal= {arXiv preprint arXiv:2411.03313},
  year   = {2024}
}

备注

NeurIPS 2024