中文

基于池化主动学习的实体匹配

机器学习 2024-03-25 v1 数据库

摘要

实体匹配的目标是从不同数据源中找出代表同一真实世界实体的对应记录。目前主流方法中,基于规则的实体匹配方法需要大量领域知识。基于机器学习或深度学习的实体匹配方法需要大量标注样本来构建模型,这在某些应用中难以实现。此外,基于学习的方法容易过拟合,因此对训练样本的质量要求很高。本文提出一种用于实体匹配任务的主动学习方法 ALMatcher。该方法仅需人工标注少量有价值样本,并利用这些样本构建高质量模型。本文提出一种混合不确定性作为查询策略,以寻找那些有价值样本进行标注,从而在满足任务需求的同时最小化标注训练样本的数量。所提方法已在七个不同领域的数据集上验证。实验表明,与使用现有方法相比,ALMatcher 仅用少量标注样本便取得了更优结果。

关键词

引用

@article{arxiv.2211.00311,
  title  = {Entity Matching by Pool-based Active Learning},
  author = {Youfang Han and Chunping Li},
  journal= {arXiv preprint arXiv:2211.00311},
  year   = {2024}
}