中文

TreeEval:通过树规划实现大语言模型的无基准评估

计算与语言 2024-12-16 v2 人工智能

摘要

最近,建立了许多新基准来评估大语言模型 (LLMs) 的性能,方法要么是计算整体得分,要么是使用另一个 LLM 作为评判者。然而,由于基准的公开访问和评估过程的不灵活,这些方法存在数据泄露问题。为解决此问题,我们引入了 TreeEval\textbf{TreeEval},这是一种针对 LLMs 的无基准评估方法,它让高性能 LLM 主持不可复现的评估会话,从而从根本上避免数据泄露。此外,该 LLM 充当考官,利用树规划策略提出一系列主题相关问题,该策略考虑当前评估状态以决定下一个问题的生成,并确保评估过程的完整性和效率。我们评估了 6 个不同参数规模的模型,包括 7B、13B 和 33B,最终仅使用约 45 个问题就实现了与 AlpacaEval2.0 最高的相关系数。我们还进行了更多分析以展示 TreeEval 的鲁棒性和可靠性。我们的代码可通过提供的 https://github.com/Ashura5/TreeEval 访问。

关键词

引用

@article{arxiv.2402.13125,
  title  = {TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning},
  author = {Xiang Li and Yunshi Lan and Chao Yang},
  journal= {arXiv preprint arXiv:2402.13125},
  year   = {2024}
}