SemPipes -- 面向表格机器学习管道的可优化语义数据算子
机器学习
2026-02-06 v1 数据库
摘要
实际的表格数据机器学习依赖复杂的数据准备管线,以实现预测、数据集成、数据增强和调试。设计这些管线需要大量的领域专业知识和工程 effort,这激发了如何通过代码合成让大型语言模型(LLM)支持表格机器学习的问题。我们引入 SemPipes,这是一种新型的声明式编程模型,将 LLM 驱动的语义数据算子集成到表格机器学习管线中。语义算子以自然语言指定数据转换,同时将执行委托给运行时系统。在训练期间,SemPipes 根据数据特征、算子指令和管线上下文合成定制算子实现。这种设计通过 LLM 驱动的代码合成(以进化搜索为导向)实现了管线中数据操作的自动优化。我们在多种表格机器学习任务上评估了 SemPipes,结果表明,语义算子在专家设计的管线和智能体生成的管线中,均显著提升了端到端预测性能,同时降低了管线复杂度。我们实现了 SemPipes 的 Python 版本,并在 https://github.com/deem-data/sempipes/tree/v1 发布。
引用
@article{arxiv.2602.05134,
title = {SemPipes -- Optimizable Semantic Data Operators for Tabular Machine Learning Pipelines},
author = {Olga Ovcharenko and Matthias Boehm and Sebastian Schelter},
journal= {arXiv preprint arXiv:2602.05134},
year = {2026}
}