超越阿罗不可能:从多准则基准测试的不可能性到可能性
机器学习
2026-02-10 v1 计算机科学与博弈论
机器学习
摘要
现代基准测试如 HELM MMLU 考虑多个指标如准确率、鲁棒性和效率。当尝试将这些指标转化为单一排名时,自然的聚合程序可能在模型集合变化时变得不连贯或不稳定。我们将这种聚合形式化为社会选择问题,其中每个指标在每个数据集上对模型的偏好排名被聚合器在指标之间投票。虽然先前工作聚焦于阿罗不可能结果,但我们认为不可能性往往源于病例示例,并识别了这些消失的充分条件,使得有意义的多准则基准测试成为可能。特别是,我们处理三种对排名组合的限制,证明在单峰、群分离和距离受限偏好下,聚合器允许构建对涉及模型的恰当排名。实验上,我们检验了诸如 HELM MMLU 等现代基准套件,验证哪些结构条件在哪些基准问题中被满足。
关键词
引用
@article{arxiv.2602.07593,
title = {Beyond Arrow: From Impossibility to Possibilities in Multi-Criteria Benchmarking},
author = {Polina Gordienko and Christoph Jansen and Julian Rodemann and Georg Schollmeyer},
journal= {arXiv preprint arXiv:2602.07593},
year = {2026}
}