Chain-of-Thought Hub:持续评测大语言模型推理性能的开放平台
计算与语言
2023-05-30 v1 人工智能
机器学习
摘要
随着大语言模型(LLMs)的不断开发,其评估变得日益重要却也充满挑战。本文提出 Chain-of-Thought Hub,一个关于大语言模型多步推理能力的开源评测套件。我们关注该设定有两个原因:(1)从 GPT 和 PaLM 模型系列的行为中,我们观察到复杂推理很可能是较弱与较强 LLM 之间的关键区分因素;(2)我们设想大语言模型成为下一代计算平台并催生基于 LLM 的新应用生态,这自然要求基础模型执行常涉及语言与逻辑操作组合的复杂任务。我们的方法是编译一套具有挑战性的推理基准来追踪 LLM 的进展。当前结果显示:(1)模型规模与推理能力明显相关;(2)截至 2023 年 5 月,Claude-v1.3 和 PaLM-2 是唯一两个可与 GPT-4 相媲美的模型,而开源模型仍落后;(3)LLaMA-65B 表现接近 code-davinci-002,表明通过人类反馈强化学习(RLHF)等后续成功开发,其有极大潜力接近 GPT-3.5-Turbo。我们的结果还表明,为使开源努力迎头赶上,社区可更专注于构建更好的基础模型并探索 RLHF。
引用
@article{arxiv.2305.17306,
title = {Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance},
author = {Yao Fu and Litu Ou and Mingyu Chen and Yuhao Wan and Hao Peng and Tushar Khot},
journal= {arXiv preprint arXiv:2305.17306},
year = {2023}
}
备注
Preprint. Code at https://github.com/FranxYao/chain-of-thought-hub