中文

TuringQ:面向计算理论的 AI 理解基准

材料科学 2025-04-28 v1 无序系统与神经网络

摘要

我们提出 TuringQ,这是第一个专为评估大语言模型(LLM)在计算理论中推理能力而设计的基准测试。TuringQ 包含 4006 对大学生和研究生水平的问答对,按难度分为四个等级,涵盖七个核心理论领域。我们评估了多个开源 LLM 以及 GPT-4,使用链式思考(Chain of Thought)提示方法和专家人类评估。此外,我们提出了一个基于 LLM 的自动评估系统,显示其准确率与人类评估相当。对 Llama3-8B 模型在 TuringQ 上进行微调可显著提升推理能力,并在代数等跨域任务中取得改善。TuringQ 既是基准也是提升 LLM 在复杂计算推理任务中性能的资源。我们的分析提供了对 LLM 能力的洞见,推动了 AI 对计算机科学理论的理解。

关键词

引用

@article{arxiv.2410.06546,
  title  = {Iron phosphate glass structure at different length scale with emphasis on the medium range: a classical molecular dynamic study},
  author = {Shakti Singh and Manan Dholakia and Sharat Chandra},
  journal= {arXiv preprint arXiv:2410.06546},
  year   = {2025}
}

备注

25 pages, 12 figures