少数据,更快收敛:基于目标导向的数据优化用于多模态指令调优
计算机视觉与模式识别
2026-03-16 v1 机器学习
摘要
多模态指令调优往往计算效率低下,因为训练预算分散在大型混合图像-视频池中,其效用高度不均。我们提出了目标导向数据优化 (GDO),一个为每个候选样本计算六个描述符并为不同目标构建优化 1x 训练子集的框架。在固定一个 epoch 的 Qwen3-VL-8B-Instruct 训练和评估配方(使用 8 张 H20 GPU)下,GDO 使用远少于 Uni-10x 基线的训练样本,即可实现更快的收敛并获得更高准确率。相对于固定 512k 样本的 Uni-10x 基线,GDO 在 MVBench 上仅使用 35.4k 样本即可达到 Uni-10x 参考值,在 VideoMME 上仅需 26.6k 样本,在 MLVU 上仅需 27.3k 样本,在 LVBench 上仅需 34.7k 样本,同时分别提高 1.38、1.67、3.08 和 0.84 个百分点。提升幅度最大的是 MVBench 和 MLVU,而 LVBench 由于其超长视频设置以及该基准与短视频/图像主导训练池之间的不匹配,改进幅度较小。在 MinLoss、Diverse、Temp 和 Temp+之间,随着时间依赖性的加强,长视频理解行为逐渐得到更好提升。总体而言,GDO 提供了一个基于目标的数据优化框架,使我们能够在固定训练协议下以更少的训练样本实现更快的收敛。代码可在 https://github.com/rujiewu/GDO 获取。
引用
@article{arxiv.2603.12478,
title = {Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning},
author = {Rujie Wu and Haozhe Zhao and Hai Ci and Yizhou Wang},
journal= {arXiv preprint arXiv:2603.12478},
year = {2026}
}