中文

大语言模型能否打扫你的数据麻烦?对应用就绪数据准备中大语言模型方法的综述

数据库 2026-01-27 v1 人工智能 计算与语言 机器学习

摘要

数据准备旨在去噪原始数据集,发现跨数据集关系,并从中提炼有价值的洞见,这是广泛数据中心应用的必备环节。驱动本领域快速发展的动力包括(i)日益增长的对应用就绪数据(如分析、可视化、决策)的需求,(ii)日益强大的大语言模型技术,以及(iii)促进灵活代理构建基础设施的出现(如Databricks Unity Catalog)。大语言模型增强的方法正迅速成为数据准备的变革性且潜在主导性范式。通过调查数百篇近期文献,本文系统性地综述了这一演变图景,聚焦于大语言模型技术用于为多样下游任务准备数据的方法。首先,我们刻画了从基于规则、模型特定管道向以提示驱动、上下文感知和代理导向准备工作流程的根本范式转变。接着,我们引入以任务为中心的分类法,将该领域组织为三个主要任务:数据清洗(如标准化、错误处理、插值)、数据集成(如实体匹配、模式匹配)和数据丰富(如数据标注、轮廓分析)。对于每个任务,我们梳理了代表性技术,阐明其优势(如改进的泛化能力、语义理解)与局限(如规模化大语言模型的高昂成本、即便在高级代理中仍存的幻觉问题、先进方法与薄弱评估之间的错位)。此外,我们分析了常用的数据集与评估指标(实证部分)。最后,我们讨论了开放性研究挑战,并勾勒了一项前瞻性路线图,强调可扩展的大语言模型-数据系统、可靠代理工作流程的原则性设计,以及稳健的评估协议。

关键词

引用

@article{arxiv.2601.17058,
  title  = {Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs},
  author = {Wei Zhou and Jun Zhou and Haoyu Wang and Zhenghao Li and Qikang He and Shaokun Han and Guoliang Li and Xuanhe Zhou and Yeye He and Chunwei Liu and Zirui Tang and Bin Wang and Shen Tang and Kai Zuo and Yuyu Luo and Zhenzhe Zheng and Conghui He and Jingren Zhou and Fan Wu},
  journal= {arXiv preprint arXiv:2601.17058},
  year   = {2026}
}

备注

Please refer to our repository for more details: https://github.com/weAIDB/awesome-data-llm