中文

解码文本片段以实现高效准确的命名实体识别

计算与语言 2026-04-23 v1

摘要

命名实体识别(NER)是工业信息抽取流程中的关键组成部分,系统除了需要具备高准确率外,还必须满足严格的延迟和吞吐量约束。最先进的 NER 准确率通常由基于片段的框架实现,这些框架从词元编码构建片段表示并对候选片段进行分类。然而,许多基于片段的方法会枚举大量候选,并使用标记增强的输入处理每个候选,这显著增加了推理成本,并限制了大规模部署中的可扩展性。在这项工作中,我们提出了 SpanDec,一个针对此瓶颈的高效基于片段的 NER 框架。我们的核心见解是,片段表示交互可以在最终的 Transformer 阶段有效计算,通过一个专用于片段表示的轻量级解码器,避免了早期层中的冗余计算。我们进一步在枚举过程中引入了一种片段过滤机制,以在昂贵的处理之前剪除不太可能的候选。在多个基准测试中,SpanDec 在匹配具有竞争力的基于片段的基线性能的同时,提高了吞吐量并降低了计算成本,实现了更适合高容量服务和设备端应用的准确率-效率权衡。

关键词

引用

@article{arxiv.2604.20447,
  title  = {Decoding Text Spans for Efficient and Accurate Named-Entity Recognition},
  author = {Andrea Maracani and Savas Ozkan and Junyi Zhu and Sinan Mutlu and Mete Ozay},
  journal= {arXiv preprint arXiv:2604.20447},
  year   = {2026}
}