中文

WildBench: 使用真实用户挑战性任务对大型语言模型进行基准测试

计算与语言 2024-10-08 v2 人工智能

摘要

我们介绍了WildBench,一个自动评估框架,旨在使用具有挑战性的真实世界用户查询对大型语言模型(LLM)进行基准测试。WildBench包含从超过一百万个人机对话日志中精心挑选的1024个任务。为了使用WildBench进行自动评估,我们开发了两个指标:WB-Reward和WB-Score,它们可以使用先进的LLM(如GPT-4-turbo)计算。WildBench评估使用任务特定的检查表系统地评估模型输出,并提供结构化的解释来证明分数和比较的合理性,从而产生更可靠和可解释的自动判断。WB-Reward在模型响应之间进行细粒度的成对比较,生成五种可能的结果:好得多、稍好、稍差、差得多或平局。与之前使用单一基线模型的评估不同,我们选择了三个不同性能水平的基线模型,以确保全面的成对评估。此外,我们提出了一种简单的方法来减轻长度偏差,如果获胜响应比失败响应多出超过KK个字符,则将“稍好/稍差”的结果转换为“平局”。WB-Score单独评估模型输出的质量,使其成为一种快速且成本效益高的评估指标。WildBench结果显示,在困难任务上与Chatbot Arena的人类投票Elo评分有很强的相关性。具体来说,WB-Reward与顶级模型的Pearson相关系数达到0.98。此外,WB-Score达到0.95,超过了ArenaHard的0.91和AlpacaEval2.0的长度控制胜率0.89以及常规胜率0.87。

关键词

引用

@article{arxiv.2406.04770,
  title  = {WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild},
  author = {Bill Yuchen Lin and Yuntian Deng and Khyathi Chandu and Faeze Brahman and Abhilasha Ravichander and Valentina Pyatkin and Nouha Dziri and Ronan Le Bras and Yejin Choi},
  journal= {arXiv preprint arXiv:2406.04770},
  year   = {2024}
}

备注

Link: https://hf.co/spaces/allenai/WildBench