EnsembleLink:无训练数据的准确记录链接
计算与语言
2026-03-03 v2
摘要
记录链接是将指指同一实体的记录在不同数据集之间匹配的过程,这是经验社会科学的关键步骤,但在方法学上仍不够发达。研究者将其当作预处理步骤,采用 ad hoc 规则且没有量化链接错误引入到下游分析中的不确定性。现有方法要么准确率低,要么需要大量标记训练数据。我提出了 EnsembleLink 方法,在没有任何训练标签的情况下实现高准确率。EnsembleLink 利用预训练语言模型,这些模型从大型文本语料库中学习了语义关系(例如,"South Ozone Park" 是 "New York City" 的一个社区,或 "Lutte ouvriere" 指的是托洛茨基 "Workers' Struggle" 派系)。在涵盖城市名称、人名、组织机构、多语言政治党派和书目记录的基准测试上,EnsembleLink 与需要大量标记的各种方法相当或更好。该方法在本地运行于开源模型上,不需要外部 API 调用,通常在几分钟内完成常规链接任务。
引用
@article{arxiv.2601.21138,
title = {EnsembleLink: Accurate Record Linkage Without Training Data},
author = {Noah Dasanaike},
journal= {arXiv preprint arXiv:2601.21138},
year = {2026}
}