中文

微调的多模态语言模型是高质量的图像-文本数据过滤器

计算机视觉与模式识别 2024-03-06 v1 计算与语言

摘要

我们提出了一种新颖的框架,通过利用微调的多模态语言模型(MLM)来过滤图像-文本数据。我们的方法通过整合MLM的最新进展,优于主流的过滤方法(例如CLIPScore)。我们设计了四个不同但互补的指标来全面衡量图像-文本数据的质量。建立了一个新的流程来构建高质量的指令数据,用于微调MLM作为数据过滤器。与CLIPScore相比,我们的MLM过滤器产生更精确和全面的分数,直接提高了过滤数据的质量,并提升了预训练模型的性能。我们在流行的基础模型(即CLIP和BLIP2)以及各种下游任务上取得了比CLIPScore显著的改进。我们的MLM过滤器可以推广到不同的模型和任务,并可作为CLIPScore的直接替代品。还提供了额外的消融研究来验证我们对MLM过滤器的设计选择。

关键词

引用

@article{arxiv.2403.02677,
  title  = {Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters},
  author = {Weizhi Wang and Khalil Mrini and Linjie Yang and Sateesh Kumar and Yu Tian and Xifeng Yan and Heng Wang},
  journal= {arXiv preprint arXiv:2403.02677},
  year   = {2024}
}

备注

Project Website: https://mlm-filter.github.io