中文

TurtleBench: 通过真实世界的是/否谜题评估顶级语言模型

计算与语言 2024-10-08 v1

摘要

随着大型语言模型应用的扩展,对可靠评估的需求也在增加。现有的LLM评估基准主要依赖静态数据集,这使得评估模型在与用户动态交互中的性能变得具有挑战性。此外,这些基准通常依赖于特定的背景知识,使得衡量模型的逻辑推理能力变得复杂。其他基于强模型或人工的动态评估方法可能会引入偏差,并导致高昂的成本和时间需求,阻碍了大规模应用。为了解决这些问题,我们提出了TurtleBench。TurtleBench从我们开发的在线海龟汤谜题平台收集真实的用户猜测。这种方法允许相对动态地生成评估数据集,在降低模型作弊风险的同时,使评估更贴近用户对推理能力的真实需求,从而提高了评估的可靠性。TurtleBench包含1,532条用户猜测及其标注后的正确性。利用这个数据集,我们全面评估了当前九个最先进的LLM。值得注意的是,OpenAI o1系列模型在这些评估中并未取得领先结果。我们提出了几个假设供进一步研究,例如“o1的潜在推理利用了琐碎的思维链技术”和“增加CoT长度不仅带来推理收益,也引入了噪声成本”。

关键词

引用

@article{arxiv.2410.05262,
  title  = {TurtleBench: Evaluating Top Language Models via Real-World Yes/No Puzzles},
  author = {Qingchen Yu and Shichao Song and Ke Fang and Yunfeng Shi and Zifan Zheng and Hanyu Wang and Simin Niu and Zhiyu Li},
  journal= {arXiv preprint arXiv:2410.05262},
  year   = {2024}
}

备注

22 pages