中文

多模态推理的数据筛选中什么最重要?来自 DCVLR 挑战赛的启示

人工智能 2026-01-19 v1

摘要

我们通过 NeurIPS 2025 视觉-语言推理数据筛选(DCVLR)挑战赛研究多模态推理的数据筛选,该挑战赛通过固定模型和训练协议来隔离数据集选择。使用主要源自 Walton Multimodal Cold Start 的紧凑精选数据集,我们的提交在挑战赛中获得了第一名。通过赛后消融实验,我们表明在已对齐的基础数据集上基于难度的样本选择是性能提升的主导驱动因素。在固定训练方案下,增加数据集大小并不能可靠地提高平均准确率,而主要是减少了运行间的方差;同时,常用的多样性和合成增强启发式方法并未提供额外收益,且通常会降低性能。这些结果将 DCVLR 表征为一种饱和状态评估,并突出了对齐和难度在数据高效的多模态推理中的核心作用。

关键词

引用

@article{arxiv.2601.10922,
  title  = {What Matters in Data Curation for Multimodal Reasoning? Insights from the DCVLR Challenge},
  author = {Yosub Shin and Michael Buriek and Boris Sobolev and Pavel Bushuyeu and Vikas Kumar and Haoyang Xu and Samuel Watson and Igor Molybog},
  journal= {arXiv preprint arXiv:2601.10922},
  year   = {2026}
}