中文

PiLLar:基于 LLM 引导的枢轴表模式匹配

数据库 2026-04-30 v1

摘要

枢轴表是现代数据生态系统中数据湖的常见组成部分,准确匹配枢轴表的模式是数据集成的关键前提。本文我们聚焦于枢轴表模式匹配,这是一种新的联合模式-值匹配任务。旨在对齐枢轴表与标准关系表之间的模式,正确的匹配必须在模式层面上语义一致且在值层面上兼容。然而,由于该任务本身的数据敏感性,实际中匿名化数据的盛行对其匹配准确率和泛化能力构成重大挑战。为此,我们提出 PiLLar——首个针对枢轴表模式的匹配框架。我们首先将 PiLLar 表述为一种由 LLM 驱动的搜索范式, operates with minimal annotated privacy-compliant data,从而实现跨域训练自由适配。随后我们对该范式的误差动力学进行理论分析,以确保所提出方法的渐近收敛。进一步地,我们引入新的基准 PTbench,从四个具有代表性的实际领域中派生:通过挖掘适合反向透视的表,对语义连贯属性执行反向透视,并应用抽样和匿名化。广泛的实验表明,PiLLar 的卓越性,其在正确预测匹配上的平均准确率达 87.94%。

关键词

引用

@article{arxiv.2604.26356,
  title  = {PiLLar: Matching for Pivot Table Schema via LLM-guided Monte-Carlo Tree Search},
  author = {Yunjun Gao and Chuangyu Ouyang and Congcong Ge and Yifan Zhu},
  journal= {arXiv preprint arXiv:2604.26356},
  year   = {2026}
}