am-ELO:一种用于竞技场式大语言模型评估的稳定框架
人工智能
2025-05-30 v2 机器学习
摘要
竞技场式评估是现代AI模型,尤其是大语言模型(LLM)的一种基础且重要的评估范式。现有基于ELO评分系统的框架由于排名不一致以及对标注者能力差异缺乏关注,存在不可避免的不稳定性问题。在本文中,我们引入了一种新颖的稳定竞技场框架,通过增强ELO评分系统来解决这些问题。具体而言,我们用最大似然估计(MLE)方法m-ELO取代了迭代更新方法,并为MLE方法在模型排名中的一致性和稳定性提供了理论证明。此外,我们提出了am-ELO,它修改了ELO评分的概率函数以纳入标注者能力,从而能够同时估计模型得分和标注者可靠性。实验表明,该方法确保了稳定性,证明该框架为LLM提供了一种更稳健、更准确、更稳定的评估方法。
引用
@article{arxiv.2505.03475,
title = {am-ELO: A Stable Framework for Arena-based LLM Evaluation},
author = {Zirui Liu and Jiatong Li and Yan Zhuang and Qi Liu and Shuanghong Shen and Jie Ouyang and Mingyue Cheng and Shijin Wang},
journal= {arXiv preprint arXiv:2505.03475},
year = {2025}
}
备注
ICML2025 Accepted