中文

MixAtlas:面向多模态大语言模型中期训练的不确定性感知数据混合优化

机器学习 2026-04-17 v1 人工智能 计算与语言

摘要

领域重新加权可提高样本效率和下游泛化性,但多模态中期训练的数据混合优化仍 largely 未被探索。当前多模态训练配方仅沿单一维度调整混合方式,通常仅考虑数据格式或任务类型。我们提出 MixAtlas 方法,通过其产生可被检查、调整并迁移至新语料库的基准导向数据配方。MixAtlas 沿两个维度分解训练语料库:图像概念(通过 CLIP 嵌入发现的 10 个视觉域聚类)和任务监督(包括描述生成、OCR、定位、检测和 VQA 等 5 种目标类型)。采用小规模代理模型(Qwen2-0.5B)配合高斯过程代理模型与 GP-UCB 采集策略,MixAtlas 在与回归基线相同代理预算下搜索混合空间,找到更优的混合方案。在 10 项涵盖视觉理解、文档推理和多模态推理的基准测试上评估。Qwen2-7B 上,优化后的混合方案比最强基线提升 8.5%-17.6%;Qwen2.5-7B 上提升 1.0%-3.3%。两种设置均可在最少一半步数内达到基线相当的训练损失。0.5B 规模代理模型上发现的配方可迁移至 7B 规模训练,跨 Qwen 模型家族。

关键词

引用

@article{arxiv.2604.14198,
  title  = {MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining},
  author = {Bingbing Wen and Sirajul Salekin and Feiyang Kang and Bill Howe and Lucy Lu Wang and Javier Movellan and Manjot Bilkhu},
  journal= {arXiv preprint arXiv:2604.14198},
  year   = {2026}
}