GPT-NER:基于大语言模型的命名实体识别
计算与语言
2023-10-10 v4
摘要
尽管大规模语言模型(LLM)在各种 NLP 任务上已取得 SOTA 性能,其在 NER 上的表现仍显著低于有监督基线。这是由于 NER 与 LLM 两个任务之间的鸿沟:前者本质上是一个序列标注任务,而后者是一个文本生成模型。在本文中,我们提出 GPT-NER 以解决此问题。GPT-NER 通过将序列标注任务转化为 LLM 可轻松适应的生成任务来弥合鸿沟,例如,在输入文本“Columbus is a city”中查找位置实体的任务被转化为生成文本序列“@@Columbus## is a city”,其中特殊标记 @@## 标明了待提取的实体。为高效解决 LLM 的“幻觉”问题(即 LLM 强烈倾向于过度自信地将 NULL 输入标注为实体),我们提出了一种自验证策略,通过提示 LLM 向自身询问所提取的实体是否属于某个已标注的实体标签。我们在五个广泛采用的 NER 数据集上进行实验,GPT-NER 取得了与全监督基线相当的性能,据我们所知这是首次。更重要的是,我们发现 GPT-NER 在低资源与少样本设定下展现出更强的能力,当训练数据量极度稀缺时,GPT-NER 显著优于有监督模型。这证明了 GPT-NER 在标注样本数量有限的真实世界 NER 应用中的能力。
引用
@article{arxiv.2304.10428,
title = {GPT-NER: Named Entity Recognition via Large Language Models},
author = {Shuhe Wang and Xiaofei Sun and Xiaoya Li and Rongbin Ouyang and Fei Wu and Tianwei Zhang and Jiwei Li and Guoyin Wang},
journal= {arXiv preprint arXiv:2304.10428},
year = {2023}
}