中文

利用大语言模型实现实体消歧的高效表征学习

计算与语言 2024-11-19 v1 人工智能

摘要

本文提出 TriBERTa,一种利用预训练大语言模型和三元组损失函数学习实体匹配表征的监督实体消歧系统。该系统包含两步:首先,将命名实体记录输入句子级双向编码器表示变换器 (SBERT) 模型生成向量表征,随后基于三元组损失函数通过对比学习进行微调。微调后的表征用作实体匹配任务的输入,结果显示该方法比未微调的 SBERT 和传统的词频-逆文档频率 (TF-IDF) 等最先进表征高出 3% 至 19%。此外,TriBERTa 生成的表征展现出更强的鲁棒性,在多个数据集上保持持续更高的性能。作者还讨论了实体消歧在当今数据驱动环境中的重要性,以及在识别和协调不同来源重复数据时面临的挑战。他们还描述了 ER 流程,包含阻塞、实体匹配和聚类等关键步骤。

关键词

引用

@article{arxiv.2411.10629,
  title  = {Leveraging large language models for efficient representation learning for entity resolution},
  author = {Xiaowei Xu and Bi T. Foua and Xingqiao Wang and Vivek Gunasekaran and John R. Talburt},
  journal= {arXiv preprint arXiv:2411.10629},
  year   = {2024}
}

备注

22 pages and 12 figures