中文

利用大型语言模型生成带标签的矿产场站记录链接数据

信息检索 2024-12-06 v1 人工智能 计算与语言

摘要

记录链接通过识别指指同一实体的记录来整合来自不同数据源的信息。在矿产场站记录的语境下,准确的记录链接对于识别和绘制矿产资源部位至关重要。正确地将指向同一矿产资源部位的记录进行关联,有助于定义矿产区域的空间覆盖范围,从而有益于资源识别和场站数据归档。矿产场站记录属于空间记录链接范畴,因为记录包含关于物理位置和非空间属性的表格化信息。这一任务因数据异构性和规模庞大而尤为具有挑战性。虽然先前的研究在空间实体链接任务中使用预训练判别式语言模型(PLM),但往往需要大量精心策划的 ground-truth 数据进行微调。收集和创建 ground truth 数据既耗时又昂贵,因此在缺乏黄金标准数据的真实世界场景中,这类方法往往不可行。虽然大型生成式语言模型(LLM)在各种自然语言处理任务中,包括记录链接,显示出有前景的成果,但其高推理时间和资源需求仍是挑战。本文提出一种方法,利用LLM生成训练数据并对PLM进行微调,以弥补训练数据不足的需求,同时保持PLM的高效性。我们的方法在使用 ground truth 数据的传统PLM方法进行的记录链接任务中,以超过45%的F1分数提升效果,并将依赖LLM的推理时间降低了近18倍。此外,我们提供了一个自动化管道,无需人工干预,凸显了该方法克服记录链接挑战的潜力。

关键词

引用

@article{arxiv.2412.03575,
  title  = {Leveraging Large Language Models for Generating Labeled Mineral Site Record Linkage Data},
  author = {Jiyoon Pyo and Yao-Yi Chiang},
  journal= {arXiv preprint arXiv:2412.03575},
  year   = {2024}
}

备注

11 pages, 10 figures