中文

GPT-Fathom:基准测试大语言模型以解读通往GPT-4及更远的演化路径

计算与语言 2024-04-03 v6

摘要

随着大语言模型(LLMs)的快速发展,迫切需要一个全面的评估套件来衡量其能力与局限。现有的LLM排行榜常引用其他论文中报告的分值,而缺乏一致的设置与提示,这可能无意中鼓励为更好结果而挑选有利设置与提示。在本工作中,我们推出GPT-Fathom,一个构建于OpenAI Evals之上的开源且可复现的LLM评估套件。我们在对齐设置下,系统地评估了10+领先LLM以及OpenAI的遗留模型在7大能力类别、20+精选基准上的表现。我们对OpenAI早期模型的回顾性研究为从GPT-3到GPT-4的演化路径提供了宝贵洞见。当前,社区迫切想知道GPT-3如何逐步改进至GPT-4,包括诸如添加代码数据是否提升LLM推理能力、LLM哪些能力可通过SFT与RLHF改进、对齐税(alignment tax)有多少等技术细节。我们的分析阐明了其中许多问题,旨在提升先进LLM的透明度。

关键词

引用

@article{arxiv.2309.16583,
  title  = {GPT-Fathom: Benchmarking Large Language Models to Decipher the Evolutionary Path towards GPT-4 and Beyond},
  author = {Shen Zheng and Yuyu Zhang and Yijie Zhu and Chenguang Xi and Pengyang Gao and Xun Zhou and Kevin Chen-Chuan Chang},
  journal= {arXiv preprint arXiv:2309.16583},
  year   = {2024}
}

备注

Accepted by NAACL 2024