中文

利用多样性和质量过滤改进罗马尼亚语大语言模型预训练数据

计算与语言 2025-11-04 v1

摘要

大型语言模型(LLMs)最近迅速普及,在许多任务上常常达到或超越人类能力。训练LLM的关键因素之一是高质量数据的可用性和整理。对于高质量语料稀缺的代表性不足的语言,数据质量尤其关键。在这项工作中,我们研究了罗马尼亚语预训练语料库的特征和覆盖范围,并考察了它们与英语数据的差异。通过在精心标注的罗马尼亚语文本上训练一个轻量级多任务模型,我们能够分析并执行多级过滤(例如,教育价值、主题、格式),以生成高质量的预训练数据集。我们的实验展示了罗马尼亚语和英语数据中主题的显著趋势,同时通过多个基准测试上改进的LLM预训练性能证明了数据过滤的有效性。

关键词

引用

@article{arxiv.2511.01090,
  title  = {Improving Romanian LLM Pretraining Data using Diversity and Quality Filtering},
  author = {Vlad Negoita and Mihai Masala and Traian Rebedea},
  journal= {arXiv preprint arXiv:2511.01090},
  year   = {2025}
}