从平标注学习嵌套命名实体识别
计算与语言
2026-03-03 v1
摘要
嵌套命名实体识别识别包含其他实体的实体,但需要昂贵的多层标注。虽然平坦 NER 语料库丰富,但嵌套资源仍稀缺。我们研究模型是否可以仅从平坦标注中学习嵌套结构,对四种方法进行评估:字符串包含(子串匹配)、实体损坏(伪嵌套数据)、平坦中性化(减少假负号信号)以及一种混合微调+大语言模型管道。我们在拥有 29 种实体类型的俄语基准数据集 NEREL 上进行测试,其中 21% 的实体为嵌套实体。我们的最佳组合方法实现了 26.37% 的内部 F1 分数,弥合了 40% 的与完全嵌套监督之间的差距。代码已公开:https://github.com/fulstock/Learning-from-Flat-Annotations。
引用
@article{arxiv.2603.00840,
title = {Learning Nested Named Entity Recognition from Flat Annotations},
author = {Igor Rozhkov and Natalia Loukachevitch},
journal= {arXiv preprint arXiv:2603.00840},
year = {2026}
}
备注
Accepted at EACL 2026, 15 pages, 2 figures, 8 tables