中文

基于大语言模型的实体匹配

计算与语言 2024-10-21 v4 机器学习

摘要

实体匹配是决定两个实体描述是否指向同一真实世界实体的任务。实体匹配是大多数数据集成流程中的核心步骤。许多最先进的实体匹配方法依赖于预训练语言模型(PLM),如BERT或RoBERTa。这些模型用于实体匹配的两个主要缺点是:(i)模型需要大量的任务特定训练数据;(ii)微调后的模型对分布外实体缺乏鲁棒性。本文研究使用生成式大语言模型(LLM)作为依赖较少任务特定训练数据且更鲁棒的PLM基匹配器的替代方案。研究涵盖了可托管的以及可本地运行的开源LLM。我们在零样本场景和存在任务特定训练数据的场景下评估这些模型。我们比较了不同的提示设计以及模型的提示敏感性。我们表明不存在单一最佳提示,而是提示需要针对每个模型/数据集组合进行调优。我们进一步研究了(i)上下文示例的选择,(ii)匹配规则的生成,以及(iii)使用相同训练数据池微调LLM。我们的实验表明,最佳的LLM不需要或仅需少量训练样本即可达到与使用数千样本微调的PLM相当的性能。基于LLM的匹配器还对未见实体表现出更高的鲁棒性。我们展示了GPT4能够为匹配决策生成结构化解释,并可通过分析错误决策的解释自动识别匹配错误的潜在原因。我们证明该模型能够生成所识别错误类别的有意义文本描述,从而帮助数据工程师改进实体匹配流程。

关键词

引用

@article{arxiv.2310.11244,
  title  = {Entity Matching using Large Language Models},
  author = {Ralph Peeters and Aaron Steiner and Christian Bizer},
  journal= {arXiv preprint arXiv:2310.11244},
  year   = {2024}
}

备注

Published in Proceedings of the 28th International Conference on Extending Database Technology (EDBT), 25th March-28th March, 2025, ISBN 978-3-89318-098-1 on OpenProceedings.org