中文

HoneyBee:面向视觉语言推理模型的数据配方

计算机视觉与模式识别 2026-03-16 v2 机器学习

摘要

近期视觉语言模型(VLM)的进展使其在推理任务中表现高度有效。然而,构建高性能视觉语言推理训练数据集的原则仍鲜有了解。本文引入了若干数据 curated 方法,并通过严格控制训练与评估 setup 来研究其对视觉语言推理能力的影响。我们分析了上下文(图像与问题)来源的效应,实施针对性数据干预,探索了扩大图像、问题及链式思维(CoT)解答的规模。我们的发现表明:(a)上下文 source 策略对 VLM 性能影响显著;(b)来自图像标题的辅助信号以及文本-only 推理的纳入均带来显著提升;(c)扩大所有数据维度(如每个图像的唯一问题数和每个图像-问题对的唯一 CoT 数)均一致提升推理能力。鼓励这些见识的基础上,我们引入 HoneyBee,一个规模庞大且质量高效的 CoT 推理数据集,包含 250 万个实例,涵盖 35 万个图像-问题对。使用 HoneyBee 训练的 VLM 在模型规模上均超越最先进模型。例如,3B 参数的 HoneyBee 训练 VLM 在 MathVerse 上的表现分别比 SOTA 模型和 base 模型高出 7.8% 和 24.8%。此外,我们提出一种 test-time scaling 策略,可在不牺牲准确性的前提下将解码成本降低 73%。总体而言,本工作提出了改进的视觉语言推理数据集 curated 研究策略。数据可在 https://huggingface.co/datasets/facebook/HoneyBee 获取。

关键词

引用

@article{arxiv.2510.12225,
  title  = {HoneyBee: Data Recipes for Vision-Language Reasoners},
  author = {Hritik Bansal and Devendra Singh Sachan and Kai-Wei Chang and Aditya Grover and Gargi Ghosh and Wen-tau Yih and Ramakanth Pasunuru},
  journal= {arXiv preprint arXiv:2510.12225},
  year   = {2026}
}

备注

32 pages. Accepted to CVPR 2026 in Denver, Colorado, USA