TabXEval: 为何这是一个糟糕的表格? 一种用于表格评估的详尽评分准则
计算与语言
2026-04-22 v3
摘要
对表格进行定性和定量评估面临重大挑战,因为标准指标通常会忽略细微的结构和内容层面的差异。为了解决这一问题,我们提出了一种基于评分准则的评估框架,该框架将多级结构描述符与细粒度的上下文信号相结合,从而实现更精确、更一致的表格比较。在此基础上,我们引入了 TabXEval,一个详尽且可解释的两阶段评估框架。TabXEval 首先通过 TabAlign 在结构上对齐参考表格与预测表格,然后使用 TabCompare 进行语义和语法比较,提供可解释且细粒度的反馈。我们在 TabXBench 上对 TabXEval 进行了评估,这是一个包含多样化、多领域基准的数据集,具有真实的表格扰动和人工标注。敏感性-特异性分析进一步证明了 TabXEval 在各种表格任务中的鲁棒性和可解释性。代码和数据可在 https://coral-lab-asu.github.io/tabxeval/ 获取。
引用
@article{arxiv.2505.22176,
title = {TabXEval: Why this is a Bad Table? An eXhaustive Rubric for Table Evaluation},
author = {Vihang Pancholi and Jainit Bafna and Tejas Anvekar and Manish Shrivastava and Vivek Gupta},
journal= {arXiv preprint arXiv:2505.22176},
year = {2026}
}
备注
Accepeted for Findings at ACL 2025