Arena-Lite:通过基于锦标赛的直接比较实现高效可靠的大语言模型评估
计算与语言
2025-10-29 v6 人工智能
摘要
随着大语言模型(LLMs)在各领域的扩展,LLM裁判已成为系统评估的重要工具。当前基准测试通常将系统输出与基线进行比较。这种基于基线的方法虽然方便,但产生的可靠性低于系统之间的直接比较。我们提出Arena-Lite,在头对头比较之上集成了锦标赛结构。锦标赛结构和直接比较的应用消除了对基线输出的需求,减少了所需比较的次数,并允许在系统排名中获得更高的可靠性。我们进行了两项实验:(1)受控随机建模和(2)使用真实LLM裁判的经验验证。这些实验共同证明,Arena-Lite即使在数据集较小或裁判较弱的情况下,也能以更少的比较持续实现更高的可靠性。我们发布了一个易于使用的网络演示和代码,以促进Arena-Lite的采用,简化研究界和工业界的模型选择。Arena-Lite演示和代码可在 https://huggingface.co/spaces/NCSOFT/ArenaLite 获取。
引用
@article{arxiv.2411.01281,
title = {Arena-Lite: Efficient and Reliable Large Language Model Evaluation via Tournament-Based Direct Comparisons},
author = {Seonil Son and Ju-Min Oh and Heegon Jin and Cheolhun Jang and Jeongbeom Jeong and Kuntae Kim},
journal= {arXiv preprint arXiv:2411.01281},
year = {2025}
}
备注
8 pages for main body, 19 pages in total