Frequency Is What You Need:考虑词频的文本遮蔽如何提升视觉语言模型预训练
计算机视觉与模式识别
2026-01-15 v3
摘要
视觉语言模型(VLM)在训练集能缩减规模的情况下可以更高效地训练。近期工作表明,在VLM训练期间使用多种策略(截断、随机遮蔽、块遮蔽和语法遮蔽)进行文本遮蔽具有优势,并报告语法遮蔽表现最佳。本文分析了不同文本遮蔽策略对训练数据中词频的影响,并表明这种影响与模型成功率相关。这一发现激发了我们提出的基于词频的对抗语言-图像预训练遮蔽方法(CLIPF),该方法直接利用词频。广泛的实验表明,CLIPF在语法遮蔽和其他现有方法方面具有优势,特别是在输入标记数量减少时。我们表明,不仅是CLIPF,其他现有遮蔽策略在训练充分的epoch数后也能超过语法遮蔽,这一发现对于选择VLM训练的文本遮蔽方法具有实际意义。我们的代码已在线发布。
引用
@article{arxiv.2412.16148,
title = {Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training},
author = {Mingliang Liang and Martha Larson},
journal= {arXiv preprint arXiv:2412.16148},
year = {2026}
}
备注
Accepted by WACV 2026