SMUTF:利用生成式标签和混合特征进行模式匹配
计算与语言
2025-05-06 v3 人工智能
数据库
摘要
我们介绍了 SMUTF(利用生成式标签和混合特征进行模式匹配),这是一种针对大规模表格数据模式匹配 (SM) 的独特方法,该方法假设监督学习不会影响开放域任务的性能,从而实现有效的跨域匹配。该系统独特地结合了基于规则的feature engineering、预训练语言模型和生成式大语言模型。受 humanitarian exchange language 启发的创新适配中,我们为每个数据列部署了“生成式标签”,增强了 SM 的有效性。SMUTF 展现出广泛的通用性,可与任何现有的预训练嵌入、分类方法和生成模型无缝协作。认识到缺乏大量公开的 SM 数据集,我们从公开的人道主义数据中创建并开源了 HDXSM 数据集。我们相信这是目前最详尽的 SM 数据集。在各类公共数据集和新颖的 HDXSM 数据集上的评估中,SMUTF 表现出卓越的性能,在准确性和效率方面超越了现有的最先进 (SOTA) 模型,将 F1 分数提高了 11.84%,ROC 的 AUC 提高了 5.08%。代码可在 https://github.com/fireindark707/Python-Schema-Matching 获取。
引用
@article{arxiv.2402.01685,
title = {SMUTF: Schema Matching Using Generative Tags and Hybrid Features},
author = {Yu Zhang and Mei Di and Haozheng Luo and Chenwei Xu and Richard Tzong-Han Tsai},
journal= {arXiv preprint arXiv:2402.01685},
year = {2025}
}
备注
Information Systems