中文

Frequency Is What You Need:考虑词频的文本遮蔽如何提升视觉语言模型预训练

计算机视觉与模式识别 2026-01-15 v3

摘要

视觉语言模型(VLM)在训练集能缩减规模的情况下可以更高效地训练。近期工作表明,在VLM训练期间使用多种策略(截断、随机遮蔽、块遮蔽和语法遮蔽)进行文本遮蔽具有优势,并报告语法遮蔽表现最佳。本文分析了不同文本遮蔽策略对训练数据中词频的影响,并表明这种影响与模型成功率相关。这一发现激发了我们提出的基于词频的对抗语言-图像预训练遮蔽方法(CLIPF),该方法直接利用词频。广泛的实验表明,CLIPF在语法遮蔽和其他现有方法方面具有优势,特别是在输入标记数量减少时。我们表明,不仅是CLIPF,其他现有遮蔽策略在训练充分的epoch数后也能超过语法遮蔽,这一发现对于选择VLM训练的文本遮蔽方法具有实际意义。我们的代码已在线发布。

关键词

引用

@article{arxiv.2412.16148,
  title  = {Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training},
  author = {Mingliang Liang and Martha Larson},
  journal= {arXiv preprint arXiv:2412.16148},
  year   = {2026}
}

备注

Accepted by WACV 2026