中文

法国历史百科全书中的实体识别:标记与跨度分类

计算与语言 2025-06-04 v1 信息检索

摘要

历史文本中的命名实体识别(NER)因语言非标准化、古老拼写以及嵌套或重叠实体而面临独特挑战。本研究对多种NER方法进行了基准测试,涵盖经典的条件随机场(CRF)和基于spaCy的模型,以及基于Transformer的架构(如CamemBERT)和序列标注模型(如Flair)。实验在GeoEDdA数据集上进行,该数据集是从18世纪法国百科全书中提取的丰富标注语料。我们提出将NER同时建模为标记级和跨度级分类,以适应历史文档中典型的复杂嵌套实体结构。此外,我们评估了生成式语言模型在低资源场景下少样本提示的潜力。结果表明,尽管基于Transformer的模型取得了最先进性能,尤其在嵌套实体上,但当标注数据稀缺时,生成式模型提供了有前景的替代方案。本研究揭示了历史NER中的持续挑战,并提出了结合符号方法与神经网络方法的混合途径,以更好地捕捉早期现代法语的细微之处。

关键词

引用

@article{arxiv.2506.02872,
  title  = {Token and Span Classification for Entity Recognition in French Historical Encyclopedias},
  author = {Ludovic Moncla and Hédi Zeghidi},
  journal= {arXiv preprint arXiv:2506.02872},
  year   = {2025}
}