中文

基于潜在空间耦合的多模态数据混合:MaD-Mix 用于视觉语言模型训练

机器学习 2026-02-10 v1

摘要

视觉语言模型 (VLM) 通常在多样化的多模态领域上进行训练,但当前实践依赖于高昂的手动调谐。我们提出了 MaD-Mix,一个原则且计算效率高的框架,用于推导 VLM 训练的多模态数据混合。MaD-Mix 将数据混合形式化为模态感知的领域对齐最大化,并通过跨模态耦合变量从 Fenchel 对偶中获得闭形式的多模态对齐分数。MaD-Mix 系统性地处理缺失模态的领域,允许整合仅包含语言的领域。跨 0.5B 和 7B 模型的实证评估表明,MaD-Mix 在多样化基准测试上加速了 VLM 训练。在图像-文本指令调谐中,MaD-Mix 使用 22% 更少的训练步骤即可匹配人类调谐的数据混合。在复杂的三模态视频-图像-文本场景中,手动调谐变得不可行,MaD-Mix 将均匀权重的平均准确率提升,且混合计算开销极小(< 1 GPU 小时),为现代 VLM 管道的可扩展混合设计提供了支持。

关键词

引用

@article{arxiv.2602.07790,
  title  = {MaD-Mix: Multi-Modal Data Mixtures via Latent Space Coupling for Vision-Language Model Training},
  author = {Wanyun Xie and Francesco Tonin and Volkan Cevher},
  journal= {arXiv preprint arXiv:2602.07790},
  year   = {2026}
}