中文

GReaTER:数据增强与压缩后的真实表格数据生成

机器学习 2025-03-21 v1

摘要

表格数据合成不仅涉及多表格合成,还涉及生成多模态数据(如字符串和类别),从而实现多样化知识合成。然而,将数值和类别数据分离限制了表格数据生成的有效性。GReaT(Generate Realistic Tabular Data)框架使用大语言模型(LLM)对整行进行编码,无需对数据类型进行分区。尽管如此,该框架的性能受到两个限制:(1)表格数据条目缺乏足够的语义意义,限制了 LLM 利用预训练知识进行情境学习的能力;(2)复杂的多表格数据集难以建立有效的关系以实现协同。为解决这些问题,我们提出 GReaTER(Generate Realistic Tabular Data after data Enhancement and Reduction),包括:(1)数据语义增强系统通过映射提升 LLM 对表格数据的理解,实现更好的情境学习;(2)跨表格连接方法以高效建立复杂表格之间的关系。实验结果表明,GReaTER 优于 GReaT 框架。

关键词

引用

@article{arxiv.2503.15564,
  title  = {GReaTER: Generate Realistic Tabular data after data Enhancement and Reduction},
  author = {Tung Sum Thomas Kwok and Chi-Hua Wang and Guang Cheng},
  journal= {arXiv preprint arXiv:2503.15564},
  year   = {2025}
}

备注

Accepted by Data Engineering Meets Large Language Models: Challenges and Opportunities Workshop@ICDE2025 Workshop at ICDE 2025