序列搜索的 Pandora 遗憾:用于评估的严格计分规则
机器学习
2026-05-05 v1
摘要
在序列搜索中,不断测试备选项,直至找到真实类别。标准严格计分规则如对数损失是局部的,忽略备选项的排序,且与搜索效用不一致。我们指出,序列搜索诱导了一对多的结构,克服了这一局限。通过分析在不同测试成本下的最优搜索预期成本,我们推导出 Pandora 遗憾:一种闭形式、两两可加且严格良性计分规则。Panorama 遗憾既能诱导真实概率,也能惩罚秩序反转的误校正,其中干扰项跑在真实类别之后。我们的构造产生一个以 Beta 为参数的家族,在保持秩位互换与概率大小之间的惩罚权衡的同时,保留将其解释为预期搜索成本的基础解释。我们证明,对数损失、准确率和宏-F1 依赖于隐式决策模型,这些模型与序列搜索不一致。在 597 个 MedMNIST 模型中,基于 Pandora 的指标比标准替代方案更好地预测临床诊断成本,将决策理论计分规则的构建扩展到多类情形。
关键词
引用
@article{arxiv.2605.01936,
title = {Pandora's Regret: A Proper Scoring Rule for Evaluating Sequential Search},
author = {Gerardo A. Flores and Yash Deshpande and Jannis R. Brea and Ashia C. Wilson},
journal= {arXiv preprint arXiv:2605.01936},
year = {2026}
}