中文

Chatbot Arena:一个基于人类偏好评估大语言模型的开放平台

人工智能 2024-03-08 v1 计算与语言

摘要

大语言模型(LLMs)解锁了新的能力和应用;然而,评估其与人类偏好的对齐程度仍然面临重大挑战。为解决这一问题,我们推出了 Chatbot Arena,这是一个基于人类偏好评估 LLMs 的开放平台。我们的方法采用成对比较策略,并通过众包利用多样化用户群体的输入。该平台已运行数月,积累了超过 24 万张投票。本文描述了该平台,分析了迄今收集的数据,并解释了我们用于高效、准确评估和排名模型的成熟统计方法。我们确认众包问题具有足够的多样性和区分度,且众包人类投票与专家评分高度一致。这些分析共同确立了 Chatbot Arena 可信度的坚实基础。凭借其独特的价值和开放性,Chatbot Arena 已成为引用最多的 LLM 排行榜之一,被领先的 LLM 开发者和公司广泛引用。我们的演示页面公开于\url{https://chat.lmsys.org}。

关键词

引用

@article{arxiv.2403.04132,
  title  = {Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference},
  author = {Wei-Lin Chiang and Lianmin Zheng and Ying Sheng and Anastasios Nikolas Angelopoulos and Tianle Li and Dacheng Li and Hao Zhang and Banghua Zhu and Michael Jordan and Joseph E. Gonzalez and Ion Stoica},
  journal= {arXiv preprint arXiv:2403.04132},
  year   = {2024}
}