中文

表格数据增强用于机器学习:拥抱生成式 AI 的进展与前景

机器学习 2024-08-01 v1 人工智能 数据库

摘要

机器学习中的表格数据应用广泛,但获取大量高质量的表格数据用于模型训练仍然是一个重大障碍。许多工作致力于表格数据增强(TDA),通过在原始表格中添加额外数据来提升下游机器学习任务。近期,人们越来越关注利用生成式 AI 的能力来进行 TDA。因此,我们认为是时候对 TDA 的进展和未来前景进行全面综述,特别关注当前热门的生成式 AI。具体而言,我们提出了 TDA 流程的架构视图,包含三个主要步骤:预增强、增强和后增强。预增强包括为后续 TDA 铺平道路的准备任务,涵盖错误处理、表格标注、表格简化、表格表示、表格索引、表格导航、模式匹配和实体匹配。增强系统地分析当前的 TDA 方法,分为基于检索的方法(检索外部数据)和基于生成的方法(生成合成数据)。我们进一步根据增强过程的粒度将其细分为行、列、单元格和表格级别。后增强聚焦于 TDA 的数据集、评估和优化方面。我们还总结了 TDA 的当前趋势和未来方向,强调了生成式 AI 时代的有前景机遇。此外,相关论文和配套资源在 GitHub 仓库 https://github.com/SuDIS-ZJU/awesome-tabular-data-augmentation 中持续更新和维护,以反映该领域的最新进展。

关键词

引用

@article{arxiv.2407.21523,
  title  = {Tabular Data Augmentation for Machine Learning: Progress and Prospects of Embracing Generative AI},
  author = {Lingxi Cui and Huan Li and Ke Chen and Lidan Shou and Gang Chen},
  journal= {arXiv preprint arXiv:2407.21523},
  year   = {2024}
}

备注

repository maintained at https://github.com/SuDIS-ZJU/awesome-tabular-data-augmentation