关键在于置信度:一种基于大语言模型的无监督多语言历史实体链接方法
计算与语言
2026-01-14 v1
摘要
尽管随着大语言模型(LLM)的出现,自然语言处理(NLP)取得了近期进展,但由于语言变异、含噪输入以及不断演变的语义约定,历史文本的实体链接(EL)仍具挑战性。现有解决方案要么需要大量训练数据,要么依赖于限制可扩展性的特定领域规则。在本文中,我们提出了 MHEL-LLaMo(基于大语言模型的多语言历史实体链接),这是一种结合小型语言模型(SLM)和 LLM 的无监督集成方法。MHEL-LLaMo 利用多语言双编码器(BELA)进行候选检索,并利用指令微调的 LLM 通过提示链进行 NIL 预测和候选选择。我们的系统使用 SLM 的置信度分数来区分简单和困难样本,仅对困难情况应用 LLM。该策略降低了计算成本,同时防止了在简单情况下的幻觉。我们在 19 世纪和 20 世纪六种欧洲语言(英语、芬兰语、法语、德语、意大利语和瑞典语)的四个既定基准上评估了 MHEL-LLaMo。结果表明,MHEL-LLaMo 无需微调即可超越现有最先进模型,为低资源历史实体链接提供了可扩展的解决方案。MHEL-LLaMo 的实现已在 Github 上公开。
引用
@article{arxiv.2601.08500,
title = {It's All About the Confidence: An Unsupervised Approach for Multilingual Historical Entity Linking using Large Language Models},
author = {Cristian Santini and Marieke Van Erp and Mehwish Alam},
journal= {arXiv preprint arXiv:2601.08500},
year = {2026}
}