propella-1:面向大规模LLM数据策展的多属性文档标注
计算与语言
2026-02-20 v2
摘要
自FineWeb-Edu以来,用于大语言模型预训练的数据策展主要依赖于由小型分类器产生的单一标量质量分数。单一分数混淆了多个质量维度,阻碍了灵活的过滤,并且缺乏可解释性。我们提出了propella-1,一个小型多语言LLM家族(参数规模为0.6B、1.7B、4B),能够对文本文档进行18个属性的标注,这些属性被组织成六个类别:核心内容、分类、质量与价值、受众与目的、安全与合规性以及地理相关性。这些模型支持57种语言,并生成符合预定义模式的JSON结构化标注。以一款前沿商业LLM作为参考标注器进行评估时,4B模型比规模大得多的通用模型取得了更高的一致性。我们发布了propella-annotations,这是一个包含超过三十亿文档标注的数据集,覆盖了主要的预训练语料库,包括来自FineWeb-2、FinePDFs、HPLT 3.0和Nemotron-CC的数据。利用这些标注,我们对广泛使用的预训练数据集进行了多维度的组成分析,揭示了单一分数方法无法捕捉到的在质量、推理深度和内容构成上的显著差异。所有模型权重和标注均在许可的商业使用许可下发布。
引用
@article{arxiv.2602.12414,
title = {propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale},
author = {Maximilian Idahl and Benedikt Droste and Björn Plüster and Jan Philipp Harries},
journal= {arXiv preprint arXiv:2602.12414},
year = {2026}
}
备注
Release: https://hf.co/collections/ellamind/propella-1