中文

文本到流水线:连接自然语言与数据准备流水线

信息检索 2025-11-11 v2 计算与语言

摘要

数据准备(DP)将原始数据转换为适合下游应用的形式,通常通过将操作组合成可执行的流水线来构建此类流水线既耗时又需要复杂的编程技能,对非专家构成了重大障碍。为降低这一障碍,我们引入了文本到流水线(Text-to-Pipeline)任务,将自然语言数据准备指令转换为DP流水线,以及PARROT,一个用于系统性评估的大规模基准测试。为确保真实的数据准备场景,PARROT通过从生产流水线中挖掘转换模式并在23,009个真实世界表格上实例化而构建,生成了约18,000个任务,涵盖16个核心操作符。我们在PARROT上的经验评估揭示了尖端LLM的一个关键失败模式:它们不仅在多步组合逻辑方面存在困难,而且在语义参数定位方面也存在困难。因此,我们建立了以Pipeline-Agent为强基线,这是一个执行感知代理,能够迭代反思中间状态。虽然它取得了最先进性能,但仍存在显著差距,凸显了PARROT中深层未解决的挑战。它为开发和评估下一代自主数据准备代理式系统提供了必要的大规模测试平台。

关键词

引用

@article{arxiv.2505.15874,
  title  = {Text-to-Pipeline: Bridging Natural Language and Data Preparation Pipelines},
  author = {Yuhang Ge and Yachuan Liu and Zhangyan Ye and Yuren Mao and Yunjun Gao},
  journal= {arXiv preprint arXiv:2505.15874},
  year   = {2025}
}