中文

R&B:面向高效基础模型训练的数据域重分组与数据混合平衡

机器学习 2025-05-02 v1 人工智能 计算与语言

摘要

数据混合策略已成功降低了语言模型训练成本。尽管有前景,但此类方法存在两个缺陷:其一,依赖于预先确定的数据域(如数据来源、任务类型),可能未捕捉关键语义细微差别,导致性能受限;其二,这些方法随数据域数量线性增长,计算开销巨大。为此,我们提出 R&B 框架,通过基于语义相似性进行数据重分组(Regroup)以创建更细粒度的数据域,并通过利用训练期间由数据域梯度诱导的格拉姆矩阵(Gram matrix)来高效优化数据组成(Balance)。与先前方法不同,R&B 无需额外计算即可获取评估信息(如损失或梯度)。我们在标准正则性条件下对该技术进行分析,提供理论依据说明 R&B 在非自适应混合方法中的有效性。实验上,我们在涵盖自然语言、推理和多模态任务的五个数据集上验证了 R&B 的有效性。即使仅增加 0.01% 的额外计算开销,R&B 也能匹配或超越当前最先进的数据混合策略的性能。

关键词

引用

@article{arxiv.2505.00358,
  title  = {R&B: Domain Regrouping and Data Mixture Balancing for Efficient Foundation Model Training},
  author = {Albert Ge and Tzu-Heng Huang and John Cooper and Avi Trost and Ziyi Chu and Satya Sai Srinath Namburi GNVV and Ziyang Cai and Kendall Park and Nicholas Roberts and Frederic Sala},
  journal= {arXiv preprint arXiv:2505.00358},
  year   = {2025}
}