先过滤图像后再生成指令:视觉指令调优的预指令数据选择
计算机视觉与模式识别
2025-04-08 v2 人工智能
机器学习
摘要
视觉指令调优(VIT)需要在大规模的图像-指令对数据集上进行训练,这在成本上具有挑战性。最近的 VIT 数据选择努力旨在从数据集中选择一小部分高质量的图像-指令对,以降低 VIT 运行时间,同时保持与全规模训练相当的性能。然而,一个常被忽视的主要挑战是:为 VIT 生成未标记图像的指令成本极高。大多数现有的 VIT 数据集依赖于人工标注或付费服务(如 GPT API),这限制了资源受限的用户为自定义应用创建 VIT 数据集的能力。为此,我们提出一种更实用的预指令数据选择(PreSel)范式,直接选择对 VIT 最有益的未标记图像,仅为所选图像生成指令。PreSel 首先估计算力任务在 VIT 数据集中每个任务的相对重要性,以派生任务级别的抽样预算。然后在每个任务内对图像特征进行聚类,选取符合预算的最具代表性的图像。该方法降低了 VIT 数据构建期间指令生成以及 LVLM 微调的计算开销。通过仅为 15% 的图像生成指令,PreSel 在 LLaVA-1.5 和 Vision-Flan 数据集上实现了与全数据 VIT 相当的性能。我们的项目页面链接为 https://bardisafa.github.io/PreSel。
引用
@article{arxiv.2503.07591,
title = {Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction Tuning},
author = {Bardia Safaei and Faizan Siddiqui and Jiacong Xu and Vishal M. Patel and Shao-Yuan Lo},
journal= {arXiv preprint arXiv:2503.07591},
year = {2025}
}
备注
Accepted at CVPR 2025 (Highlight)