Struc-Bench:大语言模型真的擅长生成复杂结构化数据吗?
计算与语言
2024-04-08 v3
摘要
尽管 GPT-4 等大型语言模型(LLMs)能力卓越,生成复杂的、结构化的表格数据仍然具有挑战性。我们的研究评估了 LLM 在构建表格方面的能力,并引入了一种新颖的、感知数据结构的微调方法来提升其性能。我们发布了 Struc-Bench,这是一个涵盖主流 LLM(GPT-NeoX-20B、GPT-3.5、GPT-4 和 Vicuna)的综合基准,涉及文本表格、HTML 和 LaTeX 格式。我们提出的 FormatCoT 有助于从预期输出中制定特定格式的指令以填充该基准。针对以任务为中心的评估存在的不足,我们提出了两个创新性指标 P-Score(Prompting Score)和 H-Score(Heuristical Score),以更准确地衡量 LLM 性能。我们的实验表明,将我们提出的感知结构的微调应用于 LLaMA-7B 可带来显著的性能提升,在大多数指标上超越其 LLM 同类模型。深入的错误分析以及从覆盖度、格式、推理、理解、语用和幻觉六个维度绘制的能力图谱,凸显了未来改进的方向并指明了后续研究路径。我们的代码和模型可在 https://github.com/gersteinlab/Struc-Bench 获取。
引用
@article{arxiv.2309.08963,
title = {Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data?},
author = {Xiangru Tang and Yiming Zong and Jason Phang and Yilun Zhao and Wangchunshu Zhou and Arman Cohan and Mark Gerstein},
journal= {arXiv preprint arXiv:2309.08963},
year = {2024}
}