中文

DataProphet: 揭示多模态大语言模型中监督数据泛化的实践

计算与语言 2026-03-23 v1

摘要

选择多模态大语言模型(MLLM)监督数据的常规智慧是优先选择看似与目标基准相似的数据集,如文本密集型或视觉导向型任务。然而,这种直观的相似性是否可靠地预测下游性能提升仍不清楚。本文着手回答一个实际问题:在进行任何训练之前,我们能否估计训练数据集对目标基准的影响?为此,我们对14个跨越7种不同任务的视觉语言数据集进行深入的迁移分析。我们的结果表明,直观的任务相似性是不可靠的预测迁�性指标,泛化性更多取决于具体数据集而非其广泛的任务类别。基于此发现,我们提出DATAPROPHET,一种简单有效的训练-free度量方法,综合多模态困惑度、相似性和数据多样性。实验表明,DATAPROPHET产生的监督数据排序与基于实际后训练性能提升的排序高度相关,Kendall's tau达到86.0%。此外,DATAPROPHET实现了更好的监督数据选择,相对于均匀选择提升最多6.9%,相对于最先进的训练-based基线提升1.4%,相对于基于实验性能的神经选择提升0.2%。我们的代码和数据将公开 release。

关键词

引用

@article{arxiv.2603.19688,
  title  = {DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs},
  author = {Xuan Qi and Luxi He and Dan Roth and Xingyu Fu},
  journal= {arXiv preprint arXiv:2603.19688},
  year   = {2026}
}

备注

14 pages