中文

ScalSelect:面向高效视觉指令微调的可扩展免训练多模态数据选择

计算机视觉与模式识别 2026-02-13 v1 人工智能

摘要

大规模视觉指令微调已成为提升视觉语言模型在各种多模态任务上性能的关键范式。然而,由于数据中的冗余,在大规模数据集上进行训练计算成本高昂且效率低下,这激发了对多模态数据选择以提高训练效率的需求。现有的视觉指令微调数据选择方法要么需要昂贵的训练,要么需要梯度计算。免训练的替代方案通常依赖于代理模型或数据集、与指令无关的表示以及具有二次复杂度的成对相似性,限制了可扩展性和表示保真度。在这项工作中,我们提出了ScalSelect,一种可扩展的免训练多模态数据选择方法,其时间复杂度相对于样本数量是线性的,无需外部模型或辅助数据集。ScalSelect首先通过提取目标视觉语言模型中指令标记最关注的视觉特征来构建样本表示,捕获与指令相关的信息。然后,它识别出其表示最能逼近完整数据集表示的主导子空间的样本,从而无需成对比较即可实现可扩展的重要性评分。在多个视觉语言模型、数据集和选择预算上的大量实验表明,ScalSelect仅使用16%的数据就达到了在全数据集上训练性能的97.5%以上,并且在某些设置下甚至优于全数据训练。代码可在 https://github.com/ChangtiWu/ScalSelect 获取。

关键词

引用

@article{arxiv.2602.11636,
  title  = {ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning},
  author = {Changti Wu and Jiahuai Mao and Yuzhuo Miao and Shijie Lian and Bin Yu and Xiaopeng Lin and Cong Huang and Lei Zhang and Kai Chen},
  journal= {arXiv preprint arXiv:2602.11636},
  year   = {2026}
}

备注

The code is available at \href{https://github.com/ChangtiWu/ScalSelect}{ScalSelect}