ScoringBench: 用于评估表格基础模型的适当评分规则基准
人工智能
2026-05-05 v3
摘要
TabPFN 和 TabICL 等表格基础模型已经能够生成完整的预测分布,但现有的回归基准几乎仅通过点估计指标(RMSE、)进行评估。这恰恰丢弃了这些模型设计用于提供的分布信息——对于并非所有错误代价都相同的高风险领域而言,这是一个关键缺口。我们提出 ScoringBench,一个开放且可扩展的基准,通过一套全面的适当评分规则——包括 CRPS、CRLS、区间得分、能量得分和加权 CRPS——以及标准点估计指标来评估表格回归模型。ScoringBench 涵盖来自多个领域的 97 个回归数据集,支持通过基于 git 的排行榜进行透明的社区贡献,并提供两种互补的排序协议:基于序数的 Demsar/autorank 方法和保持量级的 z-score 排序方法。我们评估了多个模型——涵盖上下文学习器、微调基础模型、梯度提升树和多层感知器——发现模型的排序随评分规则的不同而发生显著变化:在点估计指标上表现优异的模型在概率性指标上可能排名靠后,且在一个适当评分规则下表现最好的模型在另一个评分规则下可能明显排名更低。这些结果表明,评估指标的选择并非技术细节,而是一个建模决策——对于例如尾部错误代价不成比例的应用而言,它是一个具有直接影响模型部署的领域特定需求。
引用
@article{arxiv.2603.29928,
title = {ScoringBench: A Benchmark for Evaluating Tabular Foundation Models with Proper Scoring Rules},
author = {Jonas Landsgesell and Pascal Knoll and Tizian Wenzel},
journal= {arXiv preprint arXiv:2603.29928},
year = {2026}
}