中文

Elo揭示:语言模型评估中的鲁棒性与最佳实践

计算与语言 2023-11-30 v1 人工智能

摘要

在自然语言处理(NLP)中,最初为象棋等动态博弈中选手排名设计的Elo评级系统,正越来越多地通过“A对B”成对比较用于评估大语言模型(LLMs)。然而,尽管流行,该系统是否适用于评估如LLM这类技能水平恒定的实体仍相对未被探索。我们研究了评估方法应遵循的两个基本公理:可靠性与传递性。我们对Elo行为进行了广泛评估,说明个体Elo计算表现出波动性,并深入探讨了改变Elo评级系统超参数的影响。我们表明这些公理并非总被满足,这对当前LLM比较评估的可靠性提出了质疑。若当前Elo分数的使用意在替代昂贵的LLM头对头比较,则确保排名尽可能鲁棒至关重要。在公理指导下,我们的发现为增强LLM评估方法的可靠性提供了具体准则,表明有必要重新评估现有的比较方法。

关键词

引用

@article{arxiv.2311.17295,
  title  = {Elo Uncovered: Robustness and Best Practices in Language Model Evaluation},
  author = {Meriem Boubdir and Edward Kim and Beyza Ermis and Sara Hooker and Marzieh Fadaee},
  journal= {arXiv preprint arXiv:2311.17295},
  year   = {2023}
}

备注

22 pages, 7 figures, 2 tables. Revised version of the paper accepted at GEM Workshop, EMNLP 2023