中文

Bee:解锁高级全开源多模态大语言模型的高质量语料库与全栈套件

计算机视觉与模式识别 2026-03-10 v4 人工智能

摘要

目前,完全开源的多模态大语言模型(MLLMs) lags behind 专有版本,主要由于监督微调(SFT)数据质量存在显著差距。现有的开源数据集常常 plagued by 大规模噪声和复杂推理数据(如链式思考(CoT))严重不足,阻碍了先进模型能力的开发。为解决这些挑战,我们的工作作出三项主要贡献。首先,我们引入了 Honey-Data-15M,一个约包含 1500 万对 QA 问答对的新型 SFT 数据集,经过多重清洗技术处理,并增强了一种新颖的双层(短和长)CoT 丰富策略。其次,我们引入了 HoneyPipe 数据 curated pipeline,以及其背后的框架 DataStudio,为社区提供透明且可适应的数据 curated methodology,超越静态数据集发布。最后,为了验证我们的数据集和 pipeline,我们在 Honey-Data-15M 上训练了 Bee-8B 模型。实验表明,Bee-8B 为完全开源 MLLMs 建立了新的最先进(SOTA)水平,性能与最近的半开源模型如 InternVL3.5-8B 相当,在某些情况下甚至超越。我们的工作为社区提供了一套基础资源,包括:Honey-Data-15M 语料库; comprising HoneyPipe 和 DataStudio 的全栈套件;训练配方;评估 harness;以及模型权重。该工作表明,坚持数据质量是发展与半开源 MLLMs 高度竞争的全开源 MLLMs 的关键路径。

关键词

引用

@article{arxiv.2510.13795,
  title  = {Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs},
  author = {Yi Zhang and Bolin Ni and Xin-Sheng Chen and Heng-Rui Zhang and Yongming Rao and Houwen Peng and Qinglin Lu and Han Hu and Meng-Hao Guo and Shi-Min Hu},
  journal= {arXiv preprint arXiv:2510.13795},
  year   = {2026}
}

备注

homepage: https://open-bee.github.io/