中文

探索用于清洗表格型机器学习数据集的 LLM 智能体

机器学习 2025-03-11 v1 人工智能

摘要

高质量、无错误的数据集是构建可靠、准确且无偏见的机器学习(ML)模型的关键要素。然而,由于传感器故障、数据录入错误或跨多个数据源的不当数据集成,现实世界的数据集经常存在错误,这会严重降低模型性能。检测和纠正这些问题通常需要量身定制的解决方案,并需要广泛的领域专业知识。因此,自动化极具挑战性,使得该过程劳动密集且繁琐。在本研究中,我们探讨了大型语言模型(LLM)能否帮助减轻手动数据清洗的负担。我们设置了一个实验,将一个 LLM 与 Python 配合,负责清洗训练数据集以提高学习算法的性能,但不具备修改训练流程或执行任何特征工程的能力。我们在多个被故意注入错误的 Kaggle 数据集上运行了该实验。结果表明,LLM 能够通过利用同一行内其他特征的上下文信息以及来自先前迭代的反馈,识别并纠正错误条目,例如不合逻辑的值或异常值。然而,它们难以检测需要理解跨多行数据分布的更复杂错误,例如趋势和偏差。

关键词

引用

@article{arxiv.2503.06664,
  title  = {Exploring LLM Agents for Cleaning Tabular Machine Learning Datasets},
  author = {Tommaso Bendinelli and Artur Dox and Christian Holz},
  journal= {arXiv preprint arXiv:2503.06664},
  year   = {2025}
}

备注

14 pages, 1 main figure, 3 plots, Published at ICLR 2025 Workshop on Foundation Models in the Wild