基于预训练语言模型的深度实体匹配
数据库
2020-09-04 v3 计算与语言
摘要
我们提出 Ditto,一种基于预训练 Transformer 语言模型的新型实体匹配系统。我们将实体匹配(EM)微调并转化为序列对分类问题,以利用此类模型并采用简单架构。我们的实验表明,直接在大型文本语料库上预训练的语言模型(如 BERT、DistilBERT 或 RoBERTa)的直截了当的应用,已显著改善匹配质量,并在基准数据集上以 F1 分数最高提升 29% 优于先前的最先进(SOTA)结果。我们还开发了三种优化技术以进一步提升 Ditto 的匹配能力。Ditto 允许通过高亮输入信息中可能在做出匹配决策时感兴趣的重要片段来注入领域知识。Ditto 还对过长的字符串进行摘要,从而仅保留基本信息并用于 EM。最后,Ditto 将文本上 SOTA 的数据增强技术适配到 EM,以(困难)样本扩充训练数据。以此方式,Ditto 被迫“更努力地学习”以提升模型的匹配能力。我们开发的优化进一步将 Ditto 的性能提升高达 9.8%。或许更令人惊讶的是,我们确定 Ditto 可用至多一半的标注数据达到先前的 SOTA 结果。最后,我们在真实世界大规模 EM 任务上展示了 Ditto 的有效性。在匹配由两个分别含 789K 和 412K 条记录的公司数据集时,Ditto 取得了 96.5% 的高 F1 分数。
引用
@article{arxiv.2004.00584,
title = {Deep Entity Matching with Pre-Trained Language Models},
author = {Yuliang Li and Jinfeng Li and Yoshihiko Suhara and AnHai Doan and Wang-Chiew Tan},
journal= {arXiv preprint arXiv:2004.00584},
year = {2020}
}
备注
To appear in VLDB 2021