这是一张坏表格吗?对表格生成评估进行深入探讨
计算与语言
2024-11-26 v3
摘要
理解生成表格是否质量良好对于使用自动方法创建或编辑文档至关重要。本 work 强调,现有的表格质量评估措施未能捕捉表格的整体语义,有时会不公平地惩罚好表格并奖励坏表格。我们提出了 TabEval,一种新颖的表格评估策略,通过首先将表格分解为自然语言原子语句列表,然后使用包含关系衡量与真实语句进行比较来捕捉表格语义。为验证我们的方法,我们构建了一个由 1,250 个多样化维基百科表格组成的数据集,涵盖广泛的主题和结构,与现有数据集的有限范围形成鲜明对比。我们将 TabEval 与现有指标进行比较,使用无监督和监督文本到表格生成方法,展示了其在四个数据集上与人类判断表格质量的相关性更强。
引用
@article{arxiv.2406.14829,
title = {Is This a Bad Table? A Closer Look at the Evaluation of Table Generation from Text},
author = {Pritika Ramu and Aparna Garimella and Sambaran Bandyopadhyay},
journal= {arXiv preprint arXiv:2406.14829},
year = {2024}
}
备注
EMNLP 2024 (short)