中文

模式血缘规模化提取:多语言管道、综合评估与语言模型基准

计算与语言 2025-08-12 v1 人工智能 数据库

摘要

企业数据管道通常跨越多个编程语言进行复杂转换,导致原始元数据与下游数据之间存在语义断层。这种“语义漂移”削弱了数据可重复性和治理能力,损害了诸如检索增强生成(RAG)和文本到 SQL 系统等服务的实用性。为此,本文提出了一种用于从多语言企业管道脚本中自动提取细粒度模式血缘的新框架。该方法识别四个关键组件:源模式、源表、转换逻辑和聚合操作,创建数据转换的标准化表示。为对血缘质量进行严格评估,本文引入模式血缘综合评估(SLiCE),该指标评估结构正确性和语义忠实性。还提出了一个新的基准,包含来自真实工业脚本的 1,700 条手动标注的血缘关系。对 12 个语言模型(从 13B 参数到 32B 参数的小型语言模型(SLMs)以及 GPT-4o 和 GPT-4 等大型语言模型(LLMs))进行了实验。结果表明,模式血缘提取的性能随模型规模和提示技术的成熟度而提升。特别是,采用单一推理轨迹的 32B 开源模型可在标准提示下实现与 GPT 系列相当的性能。这一发现表明,一种可扩展且经济实惠的部署模式感知智能体方法已成为可能。

关键词

引用

@article{arxiv.2508.07179,
  title  = {Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks},
  author = {Jiaqi Yin and Yi-Wei Chen and Meng-Lung Lee and Xiya Liu},
  journal= {arXiv preprint arXiv:2508.07179},
  year   = {2025}
}