FreshTab:从维基百科获取表格到文本生成评估的新鲜数据
计算与语言
2025-10-16 v1
摘要
表格到文本生成(从表格中生成洞察)是一项具有挑战性的任务,需要精确地分析数据。此外,现有基准的评估受到大型语言模型(LLM)训练数据污染以及领域不平衡的影响。我们引入FreshTab,一个来自维基百科的即时表格到文本基准生成方法,以解决LLM数据污染问题并实现领域敏感的评估。虽然非英语表格到文本数据集有限,FreshTab按需收集不同语言的数据集(我们除了英语外,还实验了德语、俄语和法语)。我们发现,LLMs从我们方法收集的近期表格生成的洞察在自动评估指标上明显变差,但这并未体现为LLM和人类评估之间存在差异。领域效应在所有评估中都可见,表明更平衡的领域基准更具挑战性。
引用
@article{arxiv.2510.13598,
title = {FreshTab: Sourcing Fresh Data for Table-to-Text Generation Evaluation},
author = {Kristýna Onderková and Ondřej Plátek and Zdeněk Kasner and Ondřej Dušek},
journal= {arXiv preprint arXiv:2510.13598},
year = {2025}
}
备注
To be published in INLG 2025