中文

ICONS:面向视觉语言数据选择的影响共识

计算机视觉与模式识别 2025-12-30 v4 计算与语言 机器学习

摘要

通过指令微调训练视觉语言模型依赖于跨越多样任务和领域的大规模数据混合物,但这些混合物经常包含冗余信息,导致计算成本增加却未获得比例收益。现有方法通常依赖于任务无关的启发式方法来估计数据重要性,限制了其在不同任务上的有效性。我们提出 ICONS(Gradient-based Influence CONsensus approach for vision-language data Selection),一种基于梯度的影响共识方法,用于视觉语言数据选择。我们的 метод利用一阶训练动力学来估计每个样本对验证性能的影响,然后通过多数投票将这些估计在任务之间聚合。这种跨任务共识识别出一致ingly 有价值的数据点,同时缓解了得分校准和离群点敏感性问题,实现了针对多任务混合物的稳健且可扩展的数据选择。在 LLAVA-665K 上选取 20% 数据子集(分别来自 CAMBRIAN-7M、VISION-FLAN-186K),模型保留了 98.6%(分别为 98.8%、99.8%)的完整数据集性能。我们展示了所选数据对未见任务和模型架构的泛化能力,并发布了三个紧凑子集 LLAVA-ICONS-133K、CAMBRIAN-ICONS-1.4M 和 VISION-FLAN-ICONS-37K 以高效开发视觉语言模型。

关键词

引用

@article{arxiv.2501.00654,
  title  = {ICONS: Influence Consensus for Vision-Language Data Selection},
  author = {Xindi Wu and Mengzhou Xia and Rulin Shao and Zhiwei Deng and Pang Wei Koh and Olga Russakovsky},
  journal= {arXiv preprint arXiv:2501.00654},
  year   = {2025}
}