中文

DiZiNER:基于 Pilot 注释模拟的不一致引导指令细化用于零样本命名实体识别

计算与语言 2026-04-20 v1 人工智能 机器学习

摘要

大型语言模型(LLM)通过启用零样本和少样本命名实体识别(NER)而在信息抽取(IE)方面取得了显著进展,但其生成输出仍显示出持续且系统性的错误。尽管通过指令微调取得了进展,但零样本 NER 仍远远落后于监督系统。这些反复出现的错误反映了早期人类注释进程中观察到的不一致,这些不一致通过 pilot 注释来解决。鼓励这种类比,我们引入 DiZiNER(不一致引导的指令细化通过 Pilot 注释模拟用于零样本命名实体识别),该框架模拟 pilot 注释过程,让 LLM 既作为注释者又作为监督者。多个异构 LLM 对共享文本进行注释,监督模型分析模型之间的不一致以细化任务指令。在 18 个基准数据集上,DiZiNER 实现了零样本 SOTA 结果,其中 14 个数据集的零样本最佳成绩提升了 +8.0 F1 分值,并将零样本到监督的差距缩小了超过 +11 分。它持续优于其监督者 GPT-5 mini,表明改进归功于不一致引导的指令细化而非模型容量。模型之间的成对一致性与 NER 性能呈强相关性,进一步支持了这一发现。

关键词

引用

@article{arxiv.2604.15866,
  title  = {DiZiNER: Disagreement-guided Instruction Refinement via Pilot Annotation Simulation for Zero-shot Named Entity Recognition},
  author = {Siun Kim and Hyung-Jin Yoon},
  journal= {arXiv preprint arXiv:2604.15866},
  year   = {2026}
}

备注

9 pages, 3 figures; Accepted to the ACL 2026 Main Conference