表格问答的校准置信度估计
计算与语言
2026-04-15 v1
摘要
大型语言模型(LLMs)日益用于表格问答,但结构化数据上的校准问题鲜有研究。本文系统比较了五种置信度估计方法在五个前沿LLMs和两个表格问答基准上的表现。所有模型严重高估置信度(平滑ECE为0.35-0.64,而文本问答报告为0.10-0.15)。自评估与扰动方法的二分法在两个基准和所有四个完全覆盖的模型上一致复制:自评估方法(口语化、P(True))实现的AUROC为0.42-0.76,而扰动方法(语义熵、自洽性以及本文提出的多格式一致性)实现的AUROC为0.78-0.86。经过Holm-Bonferroni校正后,模型间的配对bootstrap检验在p<0.001处拒绝原假设,GPT-4o-mini的3-seed检查给出仅0.006的每seed标准差。本文提出的多格式一致性(MFA),利用结构化数据特有的无损且确定性序列化变体(Markdown、HTML、JSON、CSV)来估计置信度,比抽样基线降低20%的API成本。MFA将ECE降低44-63%,在TableBench上对所有四个模型均具有普遍性,与抽样结合可将AUROC从0.74提升至0.82。本文次要贡献的结构感知校准,将AUROC比标准后验方法提高10个百分点。
引用
@article{arxiv.2604.12491,
title = {Calibrated Confidence Estimation for Tabular Question Answering},
author = {Lukas Voss},
journal= {arXiv preprint arXiv:2604.12491},
year = {2026}
}
备注
27 pages, 9 figures, 17 tables (8-page main body + appendix)