基于单日指令调谐的大型语言模型表格数据生成
计算机视觉与模式识别
2025-12-01 v1
摘要
表格指令调谐已成为提高大型语言模型 (LLM) 对表格数据理解的有前景的研究方向。然而,大多数现有工作仅关注表格数据上的问答与推理任务,忽略了表格数据生成问题。本 work 我们首次探讨指令调谐在提升 LLM 表格数据生成能力方面的有效性。具体而言,鉴于表格指令调谐的高数据与计算需求,我们致力于在有限数据与计算资源条件下实现表格数据生成的指令调谐。为实现此目标,我们首先构建高质量的表格指令数据集,使 LLM 能够高效理解表格数据。随后,我们在该数据集的训练集上对开源 LLM (Llama3.1-8B-Instruct) 进行指令调谐,以提升其表格数据生成性能。我们的实验结果表明,凭借高质量数据集与仅用 7K 条指令在 A100 GPU 上运行不到 6 小时,就能实现与最强商业 LLM (GPT-4o) 相当的表格数据生成性能。
引用
@article{arxiv.2511.23220,
title = {Instruction Tuning of Large Language Models for Tabular Data Generation-in One Day},
author = {Milad Abdollahzadeh and Abdul Raheem and Zilong Zhao and Uzair Javaid and Kevin Yee and Nalam Venkata Abhishek and Tram Truong-Huu and Biplab Sikdar},
journal= {arXiv preprint arXiv:2511.23220},
year = {2025}
}
备注
Accepted International Conference on Machine Learning (ICML 2025), 1st Workshop on Foundation Models for Structured Data