中文

面向高效且长尾感知的视觉-语言预训练的动态聚类数据采样

计算机视觉与模式识别 2026-05-01 v1

摘要

通过采样训练数据可以降低训练视觉-语言模型(VLM)的计算成本。先前关于高效 VLM 预训练的工作已指出语义数据平衡的重要性,即调整数据中的主题分布以提高 VLM 的准确性。然而,现有的高效预训练方法可能会不成比例地从训练语料库中移除稀有概念。因此,\emph{长尾概念}在训练数据中的代表性仍然不足,并且在训练过程中无法被有效捕获。在这项工作中,我们引入了一种\emph{基于动态聚类的采样方法(DynamiCS)},该方法对大数据簇进行下采样,对小数据簇进行上采样。该方法是动态的,因为它在每个训练周期(epoch)都应用采样。我们首先展示了动态采样对于 VLM 训练的重要性。然后,我们证明了我们的簇缩放方法的优势,该方法保持了数据中语义簇的相对顺序并强调长尾。这种方法与当前仅关注于扁平化数据语义分布的工作形成对比。我们的实验表明,DynamiCS 降低了 VLM 训练的计算成本,并为长尾概念提供了性能优势。

关键词

引用

@article{arxiv.2604.27932,
  title  = {Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training},
  author = {Mingliang Liang and Zhuoran Liu and Arjen P. de Vries and Martha Larson},
  journal= {arXiv preprint arXiv:2604.27932},
  year   = {2026}
}