中文

AnyMatch -- 一种小型语言模型的零样实体匹配

计算与语言 2024-09-10 v2 人工智能 数据库

摘要

实体匹配(EM)是确定两条记录是否指指同一真实实体的问题,这在数据集成中至关重要,例如用于产品目录或地址数据库。许多EM方法的一个主要缺点是依赖标记化示例。在我们关注的困难场景中,即零样实体匹配,针对不可见目标数据集没有标记化示例。最近,大型语言模型(LLM)在零样EM方面显示出前景,但其低吞吐量和高部署成本限制了其适用性和可扩展性。我们以AnyMatch为例,该方法是一种小型语言模型,在迁移学习设置中进行微调。我们提出了几种新颖的数据选择技术,用于生成我们的模型的微调数据,例如通过AutoML过滤器选择困难配对进行匹配、生成额外的属性级别示例,以及控制数据中的标签不平衡。我们对预测质量和部署成本进行了广泛评估,与十三种基线方法在九个基准数据集上进行比较。我们发现尽管AnyMatch参数规模较小,仍能提供具竞争力的预测质量:它在所有方法中获得第二高的F1分数,并优于一些采用数千亿参数的其他方法。此外,我们的方法在成本方面显著优势:AnyMatch的平均预测质量仅比采用专有万亿参数模型GPT-4的领先方法MatchGPT差4.4%,但AnyMatch需要的参数数量少四个数量级,且按每1000个标记的美元推理成本降低了3899倍。

关键词

引用

@article{arxiv.2409.04073,
  title  = {AnyMatch -- Efficient Zero-Shot Entity Matching with a Small Language Model},
  author = {Zeyu Zhang and Paul Groth and Iacer Calixto and Sebastian Schelter},
  journal= {arXiv preprint arXiv:2409.04073},
  year   = {2024}
}

备注

12 pages excluding references, 3 figures, and 5 tables