基于词频的图像-文本对修剪提升视觉语言模型预训练
机器学习
2024-12-11 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
我们提出一种基于词频的图像-文本对修剪方法(Word-Frequency-based Image-Text Pair Pruning, WFPP),以提高视觉语言模型(VLM)的训练效率。不同于 MetaCLIP, WFPP 无需依赖元数据,仅依据文本内容选择待修剪的图像-文本对。具体而言,WFPP 会修剪包含整个训练数据集中高频词的图像-文本对。该方法的作用是减少高频词的主导性,从而实现更均衡的词频分布,这在已知有助于改进词嵌入模型的训练。预训练完成后,我们在整个数据集上进行一次额外的微调,以获得更好的性能。我们的实验表明,对 CLIP 模型应用 WFPP 可在广泛的下游任务上提升性能。WFPP 还能通过使用更少的样本加速预训练过程。此外,我们分析了修剪前后训练数据的分布,直观展示了 WFPP 如何改变词频的平衡性。我们希望本工作能鼓励研究者在预训练 VLM 时关注训练数据中的词频分布,不局限于 CLIP。
引用
@article{arxiv.2410.10879,
title = {Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency},
author = {Mingliang Liang and Martha Larson},
journal= {arXiv preprint arXiv:2410.10879},
year = {2024}
}