Prompt-to-Leaderboard
机器学习
2025-03-11 v2 计算与语言
摘要
大型语言模型(LLM)评估通常依赖于准确率或人类偏好等聚合指标,对用户和提示词进行平均处理。这一平均处理掩盖了模型在特定用户和提示词下的性能差异。为此,我们提出了 Prompt-to-Leaderboard(P2L)方法,生成特定提示词相关的排行榜。核心思想是训练一个以自然语言提示词作为输入的 LLM,输出一组布拉德-泰利系数,用于预测人类偏好投票。生成的提示词依赖性排行榜允许进行无监督的任务特定评估、查询的最优路由、个性化,以及自动评估模型的优势与弱点。来自 Chatbot Arena 的数据表明,P2L 能更好地捕捉语言模型性能的细致格局,而不仅仅是平均后的排行榜。此外,我们的发现表明,P2L 产生提示词特定评估的能力遵循类似 LLM 本身所观察到的幂律规模。2025 年 1 月,我们基于该方法训练的路由器在 Chatbot Arena 排行榜上获得了第 1 名。我们的代码已在 GitHub 上公开:https://github.com/lmarena/p2l。
引用
@article{arxiv.2502.14855,
title = {Prompt-to-Leaderboard},
author = {Evan Frick and Connor Chen and Joseph Tennyson and Tianle Li and Wei-Lin Chiang and Anastasios N. Angelopoulos and Ion Stoica},
journal= {arXiv preprint arXiv:2502.14855},
year = {2025}
}