中文

通过大型语言模型进行历史文本命名实体识别

数字图书馆 2026-04-29 v2 人工智能 计算与语言

摘要

大型语言模型(LLM)在自然语言处理任务和领域方面已显示出惊人的多样性。其中一种任务是命名实体识别(NER),该任务涉及识别和分类文本中的专有名词,如人物、组织、地点、日期和其他特定实体。NER 在从非结构化文本中提取信息方面发挥着关键作用,使下游应用程序如从非结构化文本中进行信息检索成为可能。传统上,NER 采用监督式机器学习方法,这些方法需要大量标记训练数据。然而,历史文本 presents a unique 挑战,因为标记数据集常常稀缺或不存在,由于人工标记的高成本和专业知识要求。此外,历史语言固有的可变性和噪声,如拼写不一致和古体词汇,进一步使 develop 开发可靠的 NER 系统 for these sources 变得复杂。本研究我们探讨了将 LLM 应用于历史文档中的 NER 使用零样本和少样本提示策略,这些策略需要很少或没有特定任务的训练数据。我们的实验在 HIPE-2022(识别历史人物、地点和其他实体)数据集上进行,结果表明 LLM 在此 setting 中 can achieve 合理的强大性能。虽然其性能不及在特定注释上进行监督训练的 fully 监督模型,但结果仍令人鼓舞。这些发现表明 LLM 提供了一个在低资源或历史显著性语料库中进行信息提取的可行且高效的替代方案,在这些情况下,传统的监督方法是不可行的。

关键词

引用

@article{arxiv.2508.18090,
  title  = {Named Entity Recognition of Historical Texts via Large Language Model},
  author = {Shibingfeng Zhang and Giovanni Colavizza},
  journal= {arXiv preprint arXiv:2508.18090},
  year   = {2026}
}