TabReX:表格无参考可解释评估框架
计算与语言
2026-04-22 v2
摘要
评估大型语言模型(LLMs)生成的表格质量仍是一个开放挑战:现有指标要么将表格展平为文本而忽略结构,要么依赖固定参考而限制泛化能力。我们提出 TabReX,一个基于图推理的无参考、属性驱动的表格生成评估框架。TabReX 将源文本和生成表格均转换为规范知识图谱,通过 LLM 引导的匹配过程对齐它们,并计算可解释的、具有评分细则意识的分数,以量化结构和事实保真度。由此产生的指标提供了灵敏度与特异性之间的可控权衡,产生与人类判断一致的评价和单元格级别的错误追踪。为系统评估指标的鲁棒性,我们引入 TabReX-Bench,一个涵盖六个领域、十二种基于规划器的扰动类型、跨越三个难度层级的大规模基准。实证结果表明,TabReX 与专家排名相关性最高,在更难的扰动下保持稳定,并能实现细粒度的模型与提示词对比分析,为结构化生成系统建立了一个可信、可解释评估的新范式。
引用
@article{arxiv.2512.15907,
title = {TabReX : Tabular Referenceless eXplainable Evaluation},
author = {Tejas Anvekar and Junha Park and Aparna Garimella and Vivek Gupta},
journal= {arXiv preprint arXiv:2512.15907},
year = {2026}
}
备注
Accepted to ACL 2026 (Main Conference). Long paper