中文

MuRating:面向多语言大语言模型预训练的数据质量选择的高质量方法

计算与语言 2026-03-06 v3 人工智能 机器学习

摘要

数据质量是大型语言模型性能的关键驱动因素,但现有基于模型的数据选择方法几乎仅专注于英语。我们引入 MuRating,一个可扩展框架,将高质量英语数据质量信号传递至 17 种目标语言的单一评估器。MuRating 通过成对比较聚合多个英语“评估器”,学习统一的文档质量评分,然后通过翻译将这些判断投射到单语、跨语和平行文本对上,以训练多语言评估器。应用于网页数据,MuRating 选择英语和多语言内容的平衡子集,用于预训练 12 亿参数的 LLaMA 模型。与 QuRater、AskLLM、DCLM 等强基准方法相比,我们的方法在英语基准和多语言评估中均提升了平均准确率,尤其在知识密集型任务上取得了显著提升。我们进一步分析了翻译保真度、选择偏差以及叙事材料的欠代表,勾勒出未来工作的方向。

关键词

引用

@article{arxiv.2507.01785,
  title  = {MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining},
  author = {Zhixun Chen and Ping Guo and Wenhan Han and Yifan Zhang and Binbin Liu and Haobin Lin and Fengze Liu and Yan Zhao and Bingni Zhang and Taifeng Wang and Yin Zheng and Trevor Cohn and Meng Fang},
  journal= {arXiv preprint arXiv:2507.01785},
  year   = {2026}
}

备注

NeurIPS 2025 poster