Valentine:评估用于数据集发现的匹配技术
数据库
2021-02-16 v2
摘要
如今数据科学家搜索大型数据湖以发现和集成数据集。为了汇集不同的数据源,数据集发现方法依赖于某种形式的模式匹配:建立数据集之间对应关系的过程。传统上,模式匹配用于寻找源模式与目标模式之间匹配的列对。然而,模式匹配在数据集发现方法中的使用不同于其原始用途。如今模式匹配作为指示和排序数据集间关系的构建模块。令人惊讶的是,尽管发现方法的成功高度依赖于底层匹配算法的质量,但由于缺乏带有真值、参考方法实现和评估指标的公开可用数据集,最新的发现方法以临时方式采用现有模式匹配算法。在本文中,我们旨在纠正针对数据集发现特定需求评估模式匹配方法有效性和效率的问题。为此,我们提出 Valentine,一个可扩展的开源实验套件,用于在表格数据上执行和组织大规模自动化匹配实验。Valentine 包含了开创性模式匹配方法的实现,这些方法要么由我们从零实现(由于缺少开源代码),要么从开放仓库导入。Valentine 的贡献在于:i) 定义了数据集发现方法中遇到的四种模式匹配场景,ii) 针对数据集发现方法范围定制的规范化数据集构造过程,以及 iii) 迄今最全面的模式匹配技术评估,提供了现有技术优缺点方面的洞见,可作为未来数据集发现方法中采用模式匹配的指南。
引用
@article{arxiv.2010.07386,
title = {Valentine: Evaluating Matching Techniques for Dataset Discovery},
author = {Christos Koutras and George Siachamis and Andra Ionescu and Kyriakos Psarakis and Jerry Brons and Marios Fragkoulis and Christoph Lofi and Angela Bonifati and Asterios Katsifodimos},
journal= {arXiv preprint arXiv:2010.07386},
year = {2021}
}