Sato:表格中的上下文语义类型检测
数据库
2020-06-04 v3 计算与语言
机器学习
摘要
检测关系表中数据列的语义类型对于数据清洗、模式匹配、数据发现和语义搜索等多种数据准备与信息检索任务十分重要。然而,现有的检测方法要么在脏数据上表现不佳,要么仅支持有限数量的语义类型,要么未能利用列的表上下文,要么依赖大量训练样本。我们提出 Sato,一种混合机器学习模型,利用列值及上下文信号自动检测表中列的语义类型。Sato 将大规模表格语料上训练的深度学习模型与主题建模和结构化预测相结合,分别取得了 0.925 的支持加权 F1 分数和 0.735 的宏平均 F1 分数,显著超越最先进(SOTA)性能。我们深入分析了 Sato 的整体与逐类型性能,讨论了各建模组件及特征类别对其性能的贡献。
引用
@article{arxiv.1911.06311,
title = {Sato: Contextual Semantic Type Detection in Tables},
author = {Dan Zhang and Yoshihiko Suhara and Jinfeng Li and Madelon Hulsebos and Çağatay Demiralp and Wang-Chiew Tan},
journal= {arXiv preprint arXiv:1911.06311},
year = {2020}
}
备注
VLDB'20