利用合成数据集学习为命名实体识别排序上下文
计算与语言
2024-04-09 v3
摘要
尽管近期基于预训练 transformer 的模型能以极高准确率执行命名实体识别(NER),但当应用于如整部小说之类的长文档时,其有限范围仍是一个问题。为缓解此问题,一种解决方案是在文档级别检索相关上下文。遗憾的是,此类任务缺乏监督意味着不得不采用无监督方法。相反,我们提出使用 Alpaca(一个指令微调大语言模型(LLM))生成合成上下文检索训练数据集。利用该数据集,我们训练了一个基于 BERT 模型的神经上下文检索器,能够找到 NER 的相关上下文。我们表明,在由 40 本书的第一章组成的英文文学数据集上,我们的方法优于若干检索基线。
引用
@article{arxiv.2310.10118,
title = {Learning to Rank Context for Named Entity Recognition Using a Synthetic Dataset},
author = {Arthur Amalvy and Vincent Labatut and Richard Dufour},
journal= {arXiv preprint arXiv:2310.10118},
year = {2024}
}