中文

CleanAgent:基于大语言模型智能体的数据标准化自动化

机器学习 2025-06-03 v4 人工智能 多智能体系统

摘要

数据标准化是数据科学生命周期中的关键环节。尽管 Pandas 等工具提供了强大的功能,但其复杂性以及为不同列类型定制代码所需的人工投入带来了显著挑战。虽然 ChatGPT 等大语言模型 (LLM) 通过自然语言理解和代码生成在自动化这一过程方面展现出潜力,但仍需要专家级的编程知识以及持续的交互来优化提示。为解决这些挑战,我们的核心思路是提出一个具有声明式统一 API 的 Python 库,用于标准化不同列类型,通过简洁的 API 调用简化 LLM 的代码生成。我们首先提出 Dataprep.Clean,它是 Dataprep Python 库的一个组件,通过支持用一行代码标准化特定列类型,显著降低了编码复杂性。然后,我们引入 CleanAgent 框架,该框架整合了 Dataprep.Clean 和基于 LLM 的智能体,以实现数据标准化过程的自动化。借助 CleanAgent,数据科学家只需一次性提供需求,即可实现无需人工干预的流程。为展示 CleanAgent 的实用性,我们开发了一个用户友好的 Web 应用,允许用户使用真实世界数据集与之交互。

关键词

引用

@article{arxiv.2403.08291,
  title  = {CleanAgent: Automating Data Standardization with LLM-based Agents},
  author = {Danrui Qi and Zhengjie Miao and Jiannan Wang},
  journal= {arXiv preprint arXiv:2403.08291},
  year   = {2025}
}