中文

FiNERweb:用于可扩展多语言命名实体识别的数据集与工具

计算与语言 2025-12-17 v1

摘要

最近的多语言命名实体识别(NER)研究表明,大语言模型(LLM)可以提供有效的合成监督,但此类数据集大多作为更广泛实验的副产品出现,而非系统化、可复用的资源。我们提出 FiNERweb,一个数据集创建流程,将师生范式扩展至 91 种语言和 25 种书写系统。基于 FineWeb-Edu,我们的方法训练回归模型来识别 NER 相关 passages,并用多语言 LLM 对其进行标注,最终得到约 22.5 万条 passages,包含 23.5 万个不同的实体标签。实验表明,回归模型实现了超过 84 的 F1 值,且基于 FiNERweb 训练的模型在英语、泰语和斯瓦希里语的零样本迁移设置中获得了可比或更优的性能,尽管训练数据量仅为强基线的 1/19。此外,我们使用 LLM-as-a-judge 评估标注质量,观察到忠实度(5 分制下 3.99)和完整度(4.05)均保持高分,表明标注可靠且信息丰富。此外,我们发布了包含英文标签和目标语言对应翻译标签集的数据集,因为我们观察到在使用目标语言标签而非英文标签评估时,当前最先进模型的性能下降 0.02 至 0.09 F1。我们将 FiNERweb 及所有配套工具一并发布给研究界,以促进更有效的多语言命名实体识别学生-教师训练。

关键词

引用

@article{arxiv.2512.13884,
  title  = {FiNERweb: Datasets and Artifacts for Scalable Multilingual Named Entity Recognition},
  author = {Jonas Golde and Patrick Haller and Alan Akbik},
  journal= {arXiv preprint arXiv:2512.13884},
  year   = {2025}
}