从众包数据到高质量基准:Arena-Hard与BenchBuilder管道
机器学习
2024-10-16 v2 人工智能
计算与语言
摘要
大型语言模型(LLM)的快速演进已超过模型评估的发展,凸显持续精选新型、具挑战性基准的需求。然而,手动精选高质量、符合人类取向的基准成本高昂且耗时。为此,我们引入BenchBuilder,一种自动化管道,利用LLM从大规模众包数据集中提取高质量、开放式提示,实现持续基准更新,无需人工参与。我们将BenchBuilder应用于Chatbot Arena和WildChat-1M等数据集,提取具挑战性的提示,并利用LLM作为评判者进行自动模型评估。为验证基准质量,我们提出了新的指标来衡量基准与人类偏好之间的匹配度以及模型分离能力。我们发布Arena-Hard-Auto,包含500个由BenchBuilder精选的具挑战性提示。Arena-Hard-Auto在模型性能分离方面比MT-Bench高出3倍,与人类偏好排名相关性达98.6%,成本仅为20美元。我们的工作为从广泛数据中自动化精选基准的可扩展框架奠定了新基础。
关键词
引用
@article{arxiv.2406.11939,
title = {From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline},
author = {Tianle Li and Wei-Lin Chiang and Evan Frick and Lisa Dunlap and Tianhao Wu and Banghua Zhu and Joseph E. Gonzalez and Ion Stoica},
journal= {arXiv preprint arXiv:2406.11939},
year = {2024}
}