健康模型的多样性食谱:以法语ModernBERT为例
计算与语言
2026-02-26 v1
摘要
近年来,多样性在自然语言处理(NLP)社区中越来越受到关注。与此同时,诸如ModernBERT等最先进的Transformer模型使用了非常大的预训练数据集,这些数据集由规模而非多样性驱动。这促使我们研究多样性对ModernBERT预训练的影响。在本研究中,我们正是这样做的,明确意图是减少预训练数据集的大小,同时至少保持相当的性能。我们比较了多样性驱动的采样算法,以选出最佳算法。我们发现,在某些任务上,与同等大小的随机采样预训练数据相比,多样性驱动的采样可以获得10个百分点的提升。我们还看到,一个在多样性驱动的150M token数据集上预训练了483小时的模型,其性能可以与一个在随机驱动的2.4B token数据集上预训练了1,775小时的模型相当。
关键词
引用
@article{arxiv.2602.22014,
title = {A Diversity Diet for a Healthier Model: A Case Study of French ModernBERT},
author = {Louis Estève and Christophe Servan and Thomas Lavergne and Agata Savary},
journal= {arXiv preprint arXiv:2602.22014},
year = {2026}
}