中文

对抗少样命名实体识别中重复训练与样本依赖问题的挑战

计算与语言 2024-06-21 v2 人工智能

摘要

少样命名实体识别 (NER) 系统使用少数量化训练示例来识别实体。通用管线包括用于识别文本中实体范围的 span 检测器以及用于分配实体类型给实体的实体类型分类器。当前的 span 检测器依赖于大量手动标注来指导训练。几乎每个 span 检测器都需要在基本 span 特征上进行初始训练,然后适应特定任务的特征。这一过程导致基本特征在 span 检测器之间进行重复训练。此外,基于指标的实体类型分类器,如原型网络,通常使用衡量查询样本与实体类型参考对象之间距离的特定指标,从而将最可能的实体类型分配给查询样本。然而,这些分类器遇到了样本依赖问题,这主要源于每个实体类型参考对象可用样本有限。为解决这些挑战,我们提出了改进的少样 NER 管线。首先,我们引入一个作为岩石的 span 检测器,该检测器在开放领域的 Wikipedia 数据上进行预训练。它可用于初始化管线的 span 检测器,以减少基本特征的重复训练。其次,我们利用大型语言模型 (LLM) 设置可靠的实体类型参考对象,消除对每种类型的少量样本的依赖。我们的模型在 various 数据集上显示出优越性能,需要更少的训练步骤和人类标注数据,尤其在细粒度少样 NER 设置下,我们的模型超过了包括 ChatGPT 在内的强大基线。我们将公开发布代码、数据集、LLM 输出和模型检查点。

关键词

引用

@article{arxiv.2406.05460,
  title  = {Fighting Against the Repetitive Training and Sample Dependency Problem in Few-shot Named Entity Recognition},
  author = {Chang Tian and Wenpeng Yin and Dan Li and Marie-Francine Moens},
  journal= {arXiv preprint arXiv:2406.05460},
  year   = {2024}
}

备注

ieee access: https://doi.org/10.1109/ACCESS.2024.3374727