Auto-FuzzyJoin:无需标注样本自动编写模糊相似连接程序
数据库
2021-03-09 v1
摘要
模糊相似连接是一种在实践中被广泛使用的重要数据库算子。迄今为止,研究界仅专注于优化模糊连接的\textit{可扩展性}。然而,如今的从业者同样难以优化模糊连接的\textit{质量},因为他们面临着令人畏惧的参数空间(例如距离函数、距离阈值、分词选项等),并且常常不得不求助于手动试错方法来编写这些参数以优化模糊连接质量。这一自动生成高质量模糊连接程序的关键挑战迄今令人惊讶地很少受到关注。本工作中,我们研究“自动编写”模糊连接的问题。利用距离函数的几何解释,我们开发了无监督的\textsc{Auto-FuzzyJoin}框架,能够在给定输入表上推断合适的模糊连接程序,而无需显式人工输入(如标注训练数据)。使用\textsc{Auto-FuzzyJoin},用户仅需提供两个输入表 和 ,以及期望的精度目标 (例如0.9)。\textsc{Auto-FuzzyJoin}利用其中一个输入为参考表这一事实,自动编写满足期望精度目标 的模糊连接,同时最大化模糊连接召回率(定义为正确连接记录的数量)。在现有基准及从维基百科数据创建的包含50个模糊连接任务的新基准上的实验表明,所提出的\textsc{Auto-FuzzyJoin}显著优于现有的无监督方法,并且即使在仅使用50%真实标注作为训练数据时,与有监督方法(如Magellan和DeepMatcher)相比也出奇地具有竞争力。
引用
@article{arxiv.2103.04489,
title = {Auto-FuzzyJoin: Auto-Program Fuzzy Similarity Joins Without Labeled Examples},
author = {Peng Li and Xiang Cheng and Xu Chu and Yeye He and Surajit Chaudhuri},
journal= {arXiv preprint arXiv:2103.04489},
year = {2021}
}
备注
full version of a paper in SIGMOD 2021