面向 LLM 的动态、多语言和细粒度命名实体识别数据集 DynamicNER
计算与语言
2026-05-18 v7 人工智能
摘要
大型语言模型(LLM)的快速发展推动了其在命名实体识别(NER)方法中的应用。然而,现有数据集主要为传统机器学习方法设计,不适用于 LLM 方法,尤其在语料选择和数据集设计逻辑方面。此外,现有数据集普遍采用固定且粗粒度的实体分类,无法充分评估 LLM 方法在更广泛的泛化和情境理解能力方面的潜力,从而阻碍了其广泛应用前景的充分展示。为此,我们提出了 DynamicNER——首个面向 LLM 方法的 NER 数据集,引入动态分类,为同一实体在不同语境中提供各种实体类型和实体类型列表,充分发挥 LLM 基于 NER 的泛化能力。该数据集亦具多语言性和多细粒度特征,覆盖 8 种语言和 155 个实体类型,语料涵盖多样化领域。进一步,我们引入了CascadeNER——一种基于两阶段策略和轻量级 LLM 的新型 NER 方法,实现了在细粒度任务上的更高准确率,同时所需计算资源更少。实验表明,DynamicNER 是 LLM 基于 NER 方法的稳健且有效的基准。我们还对传统方法和 LLM 方法在该数据集上的表现进行了分析。我们的代码和数据集已公开于 https://github.com/Astarojth/DynamicNER。
引用
@article{arxiv.2409.11022,
title = {DynamicNER: A Dynamic, Multilingual, and Fine-Grained Dataset for LLM-based Named Entity Recognition},
author = {Hanjun Luo and Yingbin Jin and Xinfeng Li and Xuecheng Liu and Ruizhe Chen and Tong Shang and Kun Wang and Qingsong Wen and Zuozhu Liu},
journal= {arXiv preprint arXiv:2409.11022},
year = {2026}
}
备注
This paper is accepted by EMNLP 2025 Main Conference