中文

视觉指令调优中的高价值数据选择

计算与语言 2024-10-11 v4 计算机视觉与模式识别

摘要

视觉指令调优是构建大型视觉语言模型(LVLMs)的关键,通过学习来自多样化视觉任务指令数据的混合,可显著提升任务泛化和解决能力。以往工作通常通过启发式方式收集多个现有视觉指令数据集进行训练(甚至超过百万条指令),可能引入数据冗余并扩大训练成本。为调查此问题,我们进行了一系列经验研究,发现视觉指令数据集中存在显著冗余,且即使从几个任务中大幅减少指令数量也不会影响性能。基于此,我们提出了高价值数据选择方法 TIVE,以消除视觉指令数据中的冗余并降低训练成本。在 TIVE 中,我们首先基于梯度影响函数估计实例对其对应任务的影响分数和任务难度分数。然后,我们利用这两种分数确定所选视觉指令子集中各任务的比例,并分别为每个任务选择高价值实例。各种 LVLMs 上的实验表明,使用约仅 15% 的数据即可在八个基准测试上实现与完整数据微调模型相当的平均性能,甚至在四个基准测试上超越后者。我们的代码和数据将公开发布。

关键词

引用

@article{arxiv.2403.09559,
  title  = {Less is More: High-value Data Selection for Visual Instruction Tuning},
  author = {Zikang Liu and Kun Zhou and Wayne Xin Zhao and Dawei Gao and Yaliang Li and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2403.09559},
  year   = {2024}
}

备注

Under Review