中文

RECLIP:通过小图像训练实现的资源高效 CLIP

计算机视觉与模式识别 2023-09-01 v2

摘要

我们提出 RECLIP(Resource-efficient CLIP,资源高效 CLIP),一种最小化 CLIP(Contrastive Language Image Pretraining,对比语言图像预训练)计算资源占用的简单方法。受计算机视觉中由粗到细概念的启发,我们利用小图像高效地从大规模语言监督中学习,并在最后用高分辨率数据微调模型。由于视觉变换器的复杂度严重依赖输入图像大小,我们的方法在理论和实践上显著减少了训练资源需求。在使用相同批大小和训练轮数下,RECLIP 以比基线少 6 到 8 倍的计算资源和少 7 到 9 倍的 FLOPs 实现了极具竞争力的零样本分类和图像-文本检索精度。与最先进的对比学习方法相比,RECLIP 展示了 5 到 59 倍的训练资源节省,同时保持极具竞争力的零样本分类和检索性能。最后,RECLIP 在迁移学习到开放词汇检测任务上匹配最先进水平,在 LVIS 上达到 32 APr。我们希望这项工作为更广泛的研究社区在资源友好设定下探索语言监督预训练铺平道路。

关键词

引用

@article{arxiv.2304.06028,
  title  = {RECLIP: Resource-efficient CLIP by Training with Small Images},
  author = {Runze Li and Dahun Kim and Bir Bhanu and Weicheng Kuo},
  journal= {arXiv preprint arXiv:2304.06028},
  year   = {2023}
}

备注

Published at Transactions on Machine Learning Research