利用多样性和质量过滤改进罗马尼亚语大语言模型预训练数据
计算与语言
2025-11-04 v1
摘要
大型语言模型(LLMs)最近迅速普及,在许多任务上常常达到或超越人类能力。训练LLM的关键因素之一是高质量数据的可用性和整理。对于高质量语料稀缺的代表性不足的语言,数据质量尤其关键。在这项工作中,我们研究了罗马尼亚语预训练语料库的特征和覆盖范围,并考察了它们与英语数据的差异。通过在精心标注的罗马尼亚语文本上训练一个轻量级多任务模型,我们能够分析并执行多级过滤(例如,教育价值、主题、格式),以生成高质量的预训练数据集。我们的实验展示了罗马尼亚语和英语数据中主题的显著趋势,同时通过多个基准测试上改进的LLM预训练性能证明了数据过滤的有效性。
引用
@article{arxiv.2511.01090,
title = {Improving Romanian LLM Pretraining Data using Diversity and Quality Filtering},
author = {Vlad Negoita and Mihai Masala and Traian Rebedea},
journal= {arXiv preprint arXiv:2511.01090},
year = {2025}
}