中文

面向多语言预训练数据筛选的跨语言质量分类器研究

计算与语言 2026-04-23 v1 人工智能

摘要

随着大语言模型(LLM)规模的扩大,数据管理已从最大化数据量转向通过质量过滤来优化信噪比。然而,对于许多语言而言,本土高质量数据不足以训练出稳健的质量分类器。本研究探讨了嵌入空间中的质量标记可能表现出跨语言一致性的想法,这将允许高资源语言辅助低资源语言的数据过滤。我们评估了多种过滤策略,包括跨语言迁移、第三四分位数采样(Q3)和保留率调整。结果表明,对于一个在1030亿词元上训练的10亿参数模型,大规模多语言混合池化在排名稳定性和总体准确率方面通常优于单语基线,为高资源语言带来了增益(法语的聚合归一化准确率提高了1.2%),并在低资源语言上达到或超过了单语基线。然而,我们发现仅靠规模并不能保证稳定性。此外,对于像法语这样的高资源语言,我们证明通过第三四分位数采样(Q3)或调整保留率来优化决策边界,对于充分利用多语言信号是必要的。

关键词

引用

@article{arxiv.2604.20549,
  title  = {Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection},
  author = {Yassine Turki and Vinko Sabolčec and Bettina Messmer and Martin Jaggi},
  journal= {arXiv preprint arXiv:2604.20549},
  year   = {2026}
}

备注

Accepted at the 3rd Workshop on Navigating and Addressing Data Problems for Foundation Models (DATA-FM @ ICLR 2026). 31 pages, 4 figures