中文

VisNec:度量并利用视觉必要性进行多模态指令调优

计算机视觉与模式识别 2026-03-03 v1 人工智能

摘要

多模态指令调优的效果不仅取决于数据规模,更关键在于训练样本是否真正需要视觉推理。然是的,现有指令数据集常包含大量视觉冗余样本(可仅凭文本解决),以及可能降低学习效果的多模态错位监督。为此,我们提出VisNec(视觉必要性评分),一种原则化的数据选择框架,用于衡量视觉输入在指令调优中的边际贡献。通过比较带视觉上下文与不带视觉上下文的预测损失,VisNec识别出训练实例是视觉关键、冗余或错位的。为保持任务多样性,我们将VisNec与语义聚类结合,在每个聚类中选择高必要性样本。跨10个下游基准测试,我们仅使用VisNec选取的LLaVA-665K数据集中15%的数据,即可达到100.2%的全数据性能。在较小的Vision-Flan-186K数据集上,我们的选择不仅进一步减小数据规模,还比完整数据训练提高了15.8%。这些结果表明,度量并利用视觉必要性为高效且稳健的多模态指令调优提供了有效解决方案。代码和选取的数据子集将在接受录取后发布。

关键词

引用

@article{arxiv.2603.01195,
  title  = {VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning},
  author = {Mingkang Dong and Hongyi Cai and Jie Li and Sifan Zhou and Bin Ren and Kunyu Peng and Yuqian Fu},
  journal= {arXiv preprint arXiv:2603.01195},
  year   = {2026}
}

备注

17 pages, 4 figures