中文

am-ELO:一种用于竞技场式大语言模型评估的稳定框架

人工智能 2025-05-30 v2 机器学习

摘要

竞技场式评估是现代AI模型,尤其是大语言模型(LLM)的一种基础且重要的评估范式。现有基于ELO评分系统的框架由于排名不一致以及对标注者能力差异缺乏关注,存在不可避免的不稳定性问题。在本文中,我们引入了一种新颖的稳定竞技场框架,通过增强ELO评分系统来解决这些问题。具体而言,我们用最大似然估计(MLE)方法m-ELO取代了迭代更新方法,并为MLE方法在模型排名中的一致性和稳定性提供了理论证明。此外,我们提出了am-ELO,它修改了ELO评分的概率函数以纳入标注者能力,从而能够同时估计模型得分和标注者可靠性。实验表明,该方法确保了稳定性,证明该框架为LLM提供了一种更稳健、更准确、更稳定的评估方法。

关键词

引用

@article{arxiv.2505.03475,
  title  = {am-ELO: A Stable Framework for Arena-based LLM Evaluation},
  author = {Zirui Liu and Jiatong Li and Yan Zhuang and Qi Liu and Shuanghong Shen and Jie Ouyang and Mingyue Cheng and Shijin Wang},
  journal= {arXiv preprint arXiv:2505.03475},
  year   = {2025}
}

备注

ICML2025 Accepted