中文

CT-Eval:大语言模型中文文本到表格性能基准测试

计算与语言 2024-05-21 v1

摘要

文本到表格(Text-to-Table)旨在生成结构化表格,以传达非结构化文档中的关键信息。现有的文本到表格数据集通常面向英语,限制了非英语语言的研究。同时,大语言模型(LLMs)的出现表明其作为多语言环境下的通用任务求解器取得了巨大成功(例如ChatGPT),从理论上实现了其他语言的文本到表格任务。在本文中,我们提出了一个中文文本到表格数据集CT-Eval,用于在此任务上对LLMs进行基准测试。我们对英文文本到表格数据集的初步分析突出了数据集构建的两个关键因素:数据多样性和数据幻觉。受此启发,CT-Eval数据集选择了一个流行的中文多学科在线百科全书作为来源,涵盖28个领域以确保数据多样性。为了最小化数据幻觉,我们首先训练一个LLM来判断并过滤掉带有幻觉的任务样本,然后雇佣人工标注者清理验证集和测试集中的幻觉。经过此过程,CT-Eval包含88.6K个任务样本。使用CT-Eval,我们评估了开源和闭源LLMs的性能。我们的结果显示,零样本LLMs(包括GPT-4)与人类判断相比仍存在显著的性能差距。此外,经过微调后,开源LLMs可以显著提高其文本到表格能力,以较大优势超越GPT-4。简而言之,CT-Eval不仅帮助研究人员评估并快速了解现有LLMs的中文文本到表格能力,还作为一种宝贵资源显著提升LLMs的文本到表格性能。

关键词

引用

@article{arxiv.2405.12174,
  title  = {CT-Eval: Benchmarking Chinese Text-to-Table Performance in Large Language Models},
  author = {Haoxiang Shi and Jiaan Wang and Jiarong Xu and Cen Wang and Tetsuya Sakai},
  journal= {arXiv preprint arXiv:2405.12174},
  year   = {2024}
}

备注

10 pages