中文

通过抽样压缩标记以实现更细粒度的数据治理

机器学习 2025-03-20 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

广泛观察到的 data scaling laws 显示,误差随训练规模的幂函数下降,表明对不加选择的数据扩张具有收益递减。因此,提出了数据治理以通过修剪非信息性样本来缩小数据集。然而,由于对所有样本组合进行试验所需的计算资源巨大, isolating 单个样本对整体模型性能的影响具有挑战性。当前的数据治理者通过从启发式方法导出的标量分数来估计样本贡献,从而忽略低价值的样本。尽管经过彻底的样本筛选,保留下来的样本仍包含大量固有上述的标记,凸显了进一步压缩和净化的潜力。本文将数据治理从“筛选”方法升级为“榨汁”方法。我们不通过扫描寻找最不完美的样本,而是采用双分支 DataJuicer 进行更细粒度的样本内治理。它挤出信息丰富的标记并提升图像-文本对齐。具体而言,视觉分支保留关键图像块并提取相关对象类别,而文本分支则整合这些类别以增强标题。因此,DataJuicer 通过更细粒度的治理产生更精细的数据集。广泛的实验表明,DataJuicer 在图像-文本检索、分类和密集视觉推理任务中显著优于现有的 DataSieve。

关键词

引用

@article{arxiv.2503.14559,
  title  = {Squeeze Out Tokens from Sample for Finer-Grained Data Governance},
  author = {Weixiong Lin and Chen Ju and Haicheng Wang and Shengchao Hu and Shuai Xiao and Mengting Chen and Yuheng Jiao and Mingshuai Yao and Jinsong Lan and Qingwen Liu and Ying Chen},
  journal= {arXiv preprint arXiv:2503.14559},
  year   = {2025}
}