中文

GoldiCLIP:面向语言-图像预训练的显式监督平衡的温故而知新方法

计算机视觉与模式识别 2026-03-27 v1 人工智能 机器学习

摘要

直到最近,大规模视觉-语言模型(VLM)的成功主要依赖千亿级数据集,这构成了显著的进步障碍。最新的研究开始通过提升监督质量来缩小这一差距,但每个方法仅解决对对比预训练弱点的一部分。我们提出的 GoldiCLIP 框架基于温故而知新原则,寻找监督信号的最佳平衡。我们的多方位训练框架协同结合三项关键创新:(1)基于文本条件的自教蒸馏方法,用于对齐文本不可辨和文本条件特征;(2)集成解码器的编码器,引入视觉问答(VQA)目标,使编码器能够超越类似标题的查询进行泛化;(3)基于不确定性的加权机制,自动平衡所有异构损失。仅使用 300 万张图片训练,GoldiCLIP 的数据效率比领先方法低 300 倍,却在 MSCOCO 检索任务上超越最佳可比基线提升 2.2 分,细粒度检索提升 2.0 分,基于问题的检索提升 5.9 分,同时与规模为十亿的模型保持竞争力。项目页面:https://petsi.uk/goldiclip。

关键词

引用

@article{arxiv.2603.24804,
  title  = {GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining},
  author = {Deen Dayal Mohan and Hossein Souri and Vitali Petsiuk and Juhong Min and Gopal Sharma and Luowei Zhou and Suren Kumar},
  journal= {arXiv preprint arXiv:2603.24804},
  year   = {2026}
}