中文

NLLB-CLIP——以有限预算训练高性能多语言图像检索模型

计算机视觉与模式识别 2023-11-03 v3

摘要

如今,学术与工业机构在海量计算资源帮助下开发的大型模型呈指数级增长,这引发了一个问题:缺乏此类资源的人能否做出有价值的科学贡献。为探索此问题,我们尝试以 1,000 美元的有限预算解决多语言图像检索这一挑战性任务。作为结果,我们提出了 NLLB-CLIP——一种文本编码器来自 NLLB 模型的 CLIP 模型。为训练该模型,我们使用从 LAION COCO 数据集衍生的、含 201 种语言描述、质量为 106,246 张良好图像的数据集。我们采用不同规模的图像与文本编码器训练了多个模型,并在训练中冻结模型的不同部分。我们使用现有评估数据集以及新创建的 XTD200 和 Flickr30k-200 数据集对训练模型进行了细致分析。我们表明,NLLB-CLIP 在质量上可与 SOTA 模型媲美,并在低资源语言上显著优于它们。

关键词

引用

@article{arxiv.2309.01859,
  title  = {NLLB-CLIP -- train performant multilingual image retrieval model on a budget},
  author = {Alexander Visheratin},
  journal= {arXiv preprint arXiv:2309.01859},
  year   = {2023}
}