Schemora:基于多阶段推荐与元数据丰富化的模式匹配框架
数据库
2025-07-22 v1 人工智能
机器学习
摘要
模式匹配是集成异构数据源并提升数据集发现的关键任务,但仍是复杂且资源密集的问题。我们引入 SCHEMORA,一种模式匹配框架,结合大型语言模型与混合检索技术,采用基于提示的方法实现高效的候选匹配识别,无需依赖标注训练数据或进行穷举式两两比较。通过丰富模式元数据并利用向量检索和词典检索,SCHEMORA 提升了匹配精度和可扩展性。在 MIMIC-OMOP 基准测试中,它实现了新的状态最佳性能,HitRate@5 提升了 7.49%,HitRate@3 提升了 3.75%。据我们所知,这是首个基于大型语言模型的模式匹配方法,拥有开源实现,并伴随分析说明检索在其中发挥关键作用,提供实用模型选择指导。
引用
@article{arxiv.2507.14376,
title = {Schemora: schema matching via multi-stage recommendation and metadata enrichment using off-the-shelf llms},
author = {Osman Erman Gungor and Derak Paulsen and William Kang},
journal= {arXiv preprint arXiv:2507.14376},
year = {2025}
}
备注
11 pages