中文

视觉组合性调优

计算机视觉与模式识别 2026-05-18 v3

摘要

视觉指令调优(VIT)数据集规模正在快速增长,但个别训练样本的 informative性 尚未得到充分关注。近期的数据集选择方法表明,仅通过少数富含信息样本的子集数据集即可实现对多模态大语言模型的高效微调。本文探讨了样本复杂度对信息化数据 curated 的影响,引入 COMPACT(COMPositional Atomic-to-complex Visual Compositional Tuning),一种基于组合视觉指令调优的数据配方,通过将多个原子视觉能力组合于单个训练样本中,以提升训练样本的复杂度。具体而言,我们为每张图像合成丰富且信息丰富的文本问题,从而大幅降低实现有效 VIT 所需的训练样本数量。COMPACT 在数据效率上优于现有数据降采样方法。将其应用于 LLaVA-665K VIT 数据集时,COMPACT 在八个多模态基准测试中实现数据预算削减 90%,仍可达到 100.2% 的完整 VIT 水平(相较于最先进方法仅达 97.5%)。此外,在 particularly complex 的基准测试如 MM-Vet(+8.6%)和 MMStar(+2.9%)上,基于 COMPACT 数据的训练优于基于全量 VIT 数据的训练。COMPACT 提供了一种可扩展且高效的合成数据生成配方,以提升视觉-语言任务性能。

关键词

引用

@article{arxiv.2504.21850,
  title  = {Visual Compositional Tuning},
  author = {Xindi Wu and Hee Seung Hwang and Polina Kirichenko and Esin Tureci and Olga Russakovsky},
  journal= {arXiv preprint arXiv:2504.21850},
  year   = {2026}
}

备注

See the project website at this [URL](https://princetonvisualai.github.io/compact/)