MR-GSM8K:用于大语言模型评估的元推理基准
计算与语言
2024-06-06 v4
摘要
在本工作中,我们引入了一种针对大语言模型(LLM)的新型评估范式,迫使它们从传统的类似学生的问答角色转变为类似教师的评分角色。这种聚焦于“对推理进行推理”的范式被称为元推理(meta-reasoning),它将评估重点从往往忽视推理过程的结果导向型评估,转向了能够有效区分不同模型认知能力的更全面评估。通过将该范式应用于 GSM8K 数据集,我们开发了 MR-GSM8K 基准。我们的广泛分析涵盖了开源和商业领域的多个最先进(SOTA)模型,揭示了它们在训练和评估方法上的根本缺陷。值得注意的是,虽然 Deepseek-v2 和 Claude3-Sonnet 等模型在 GSM8K 中与 GPT-4 竞争激烈,但它们在 MR-GSM8K 中的性能差距显著扩大,差异扩大到超过 20 个绝对百分点,突显了我们元推理方法带来的巨大挑战。
引用
@article{arxiv.2312.17080,
title = {MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation},
author = {Zhongshen Zeng and Pengguang Chen and Shu Liu and Haiyun Jiang and Jiaya Jia},
journal= {arXiv preprint arXiv:2312.17080},
year = {2024}
}
备注
Code: https://github.com/dvlab-research/MR-GSM8K