中文

百万标签命名实体识别:通过GLiNER双编码器突破规模瓶颈

计算与语言 2026-02-24 v1 机器学习

摘要

本文介绍GLiNER双编码器,这是一种用于命名实体识别(NER)的新型架构,旨在实现零样本灵活性与工业级效率的融合。虽然原始GLiNER框架提供了强大的泛化能力,但其联合编码方法在实体标签数量增加时受到二次复杂度的制约。我们提出的双编码器设计将过程解耦为专用的标签编码器和上下文编码器,有效消除了上下文窗口的瓶颈。该架构使同时识别数千乃至数百万种实体类型成为可能,仅需最小的开销。实验结果表明,实现了领先的零样本性能,在CrossNER基准上达到61.5%的Micro-F1。关键在于,利用预计算的标签嵌入,GLiNER双编码器在1024个标签下相较于单编码器前身实现了最高可达130倍的吞吐量提升。此外,我们引入GLiNKER,一个模块化框架,利用此架构实现对大规模知识库(如Wikidata)的高性能实体链接。

关键词

引用

@article{arxiv.2602.18487,
  title  = {The Million-Label NER: Breaking Scale Barriers with GLiNER bi-encoder},
  author = {Ihor Stepanov and Mykhailo Shtopko and Dmytro Vodianytskyi and Oleksandr Lukashov},
  journal= {arXiv preprint arXiv:2602.18487},
  year   = {2026}
}

备注

13 pages, 1 figure, 4 tables