MMLU-Pro:一个更鲁棒且更具挑战性的多任务语言理解基准
计算与语言
2024-11-07 v6
摘要
在大规模语言模型时代,诸如大规模多任务语言理解(MMLU)之类的基准在推动AI跨领域语言理解和推理能力边界方面发挥了关键作用。然而,随着模型不断改进,它们在这些基准上的表现开始趋于平稳,使得区分模型能力差异变得越来越困难。本文介绍了MMLU-Pro,这是一个增强的数据集,旨在通过整合更具挑战性、侧重推理的问题,并将选项集从四个扩展到十个,来扩展主要基于知识的MMLU基准。此外,MMLU-Pro消除了MMLU中琐碎和嘈杂的问题。我们的实验结果表明,MMLU-Pro不仅提高了挑战性,导致准确率相比MMLU显著下降16%至33%,而且在不同的提示下表现出更高的稳定性。在测试的24种不同提示风格中,模型分数对提示变化的敏感度从MMLU的4-5%下降到MMLU-Pro的仅2%。此外,我们发现使用思维链(CoT)推理的模型在MMLU-Pro上比直接回答取得了更好的性能,这与原始MMLU上的发现形成鲜明对比,表明MMLU-Pro包含了更复杂的推理问题。我们的评估证实,MMLU-Pro是一个更具区分度的基准,能够更好地跟踪该领域的进展。
引用
@article{arxiv.2406.01574,
title = {MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark},
author = {Yubo Wang and Xueguang Ma and Ge Zhang and Yuansheng Ni and Abhranil Chandra and Shiguang Guo and Weiming Ren and Aaran Arulraj and Xuan He and Ziyan Jiang and Tianle Li and Max Ku and Kai Wang and Alex Zhuang and Rongqi Fan and Xiang Yue and Wenhu Chen},
journal= {arXiv preprint arXiv:2406.01574},
year = {2024}
}
备注
This version has been accepted and published at NeurIPS 2024 Track Datasets and Benchmarks (Spotlight)