中文

NPHardEval:基于复杂度类的大语言模型推理能力动态基准

人工智能 2024-02-13 v4 计算复杂性 计算与语言 机器学习

摘要

复杂推理能力是当前 LLM 最重要的特性之一,在复杂决策任务中也发挥着不可或缺的作用。因此,研究 Large Language Models (LLMs) 的推理能力至关重要:目前已建立了众多基准来评估 LLMs 的推理能力。然而,当前的基准无法严格评估 LLMs 所能达到的推理能力的全部范围。它们还面临过拟合的风险,因为这些基准是公开且静态的,使得模型可能会针对特定基准指标调整其响应,从而虚报其性能。针对这些局限性,我们的研究引入了一个名为 NPHardEval 的新基准。该基准旨在通过涵盖多达 NP-Hard 复杂度类的 900 个算法问题来评估 LLMs 的推理能力。这些问题经过精心挑选,代表了 NP-Hard 复杂度类以下的广泛复杂度类,为 LLMs 的推理能力提供了严格的衡量标准。通过这项研究,我们阐明了 LLMs 推理的现状,通过比较 LLMs 在各复杂度类上的表现提供了客观且严格的视角。此外,该基准设计了动态更新机制,数据点每月刷新一次。这种定期更新在降低 LLMs 对基准过拟合的风险方面发挥着关键作用,促进了对 LLMs 推理能力更准确、更可靠的评估。NPHardEval 的基准数据集和代码可在 https://github.com/casmlab/NPHardEval 获取。

关键词

引用

@article{arxiv.2312.14890,
  title  = {NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes},
  author = {Lizhou Fan and Wenyue Hua and Lingyao Li and Haoyang Ling and Yongfeng Zhang},
  journal= {arXiv preprint arXiv:2312.14890},
  year   = {2024}
}

备注

23 pages, 7 figures, 2 tables