基于概念-技能迁移性的数据选择方法用于大型视觉语言模型
计算机视觉与模式识别
2024-10-03 v2 机器学习
摘要
指令调谐或在大量任务特定数据上的监督微调是大型视觉语言模型(LVLMs)获得在广泛视觉语言(VL)任务上的良好泛化能力的必要条件。然而,在大型VL数据集上进行训练会变得昂贵。本文引入了COINCIDE,这是一种有效且可扩展的数据选择技术,使用小模型作为参考模型,以提高大型视觉语言模型目标模型微调的效率,关注多样性和迁移性。具体而言,我们使用小模型的内部激活对训练数据进行聚类,从而识别目标LVLMs所需的VL概念-技能组合。随后,我们通过考虑这些聚类的密度和迁移性(即向其他概念-技能组合迁移的能力)从中抽样数据。这种方法确保了这些组合的多样性,这是LVLMs泛化能力的关键。广泛的实验表明,COINCIDE在两个不同数据集(LLaVA-1.5和Vision-Flan)上以8种强大基线实现卓越的性能和数据选择效率。仅使用LLaVA-1.5数据集的20%,COINCIDE便实现了与在整个数据集上微调的LVLMs相当的性能, wall-clock运行时间减少70%。在Vision-Flan数据集上,我们的方法仅使用16.7%的训练数据便取得优异结果。
引用
@article{arxiv.2406.10995,
title = {Concept-skill Transferability-based Data Selection for Large Vision-Language Models},
author = {Jaewoo Lee and Boyang Li and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2406.10995},
year = {2024}
}
备注
EMNLP 2024