从语言模型的参数知识生成表格
计算与语言
2024-06-18 v1 人工智能
数据库
摘要
我们探索了从大型语言模型(LLM)的参数知识中生成事实且准确的表格。虽然 LLM 在 recreating 知识库和生成自由形式文本方面已展现出惊人的能力,但我们关注生成结构化表格数据的能力,这在金融和医疗等领域至关重要。我们检查了四种最先进 LLM 的表格生成能力:GPT-3.5、GPT-4、Llama2-13B 和 Llama2-70B,针对表格生成采用了三种提示方法:(a)整体表格、(b)逐行生成;(c)逐单元格生成。对于评估,我们引入了一个新型基准,WikiTabGen,其中包含 100 个精选维基百科表格。表格进一步处理以确保其事实正确性,并用简短的自然语言描述进行了人工标注。我们的发现表明,表格生成仍是一个挑战,GPT-4 在准确率上达到最高的 19.6%。我们的详细分析揭示了各种表格属性(如规模、流行度和数值内容)如何影响生成性能。这项工作凸显了 LLM 基于表格生成的独特挑战,并为未来研究提供了可靠的评估框架。我们的代码、提示词和数据均公开可用:https://github.com/analysis-bots/WikiTabGen
关键词
引用
@article{arxiv.2406.10922,
title = {Generating Tables from the Parametric Knowledge of Language Models},
author = {Yevgeni Berkovitch and Oren Glickman and Amit Somech and Tomer Wolfson},
journal= {arXiv preprint arXiv:2406.10922},
year = {2024}
}