评估 Llama 大型语言模型的涌现符号推理能力
计算与语言
2024-06-12 v1 人工智能
机器学习
神经与进化计算
摘要
大型语言模型(LLM)在广泛的任务中实现了惊人的性能,尽管它们通常仅以与用户聊天流畅为目标进行训练。除其他技能外,LLM 在数学推理基准测试中显示出涌现能力,这些能力可通过适当的提示方法被激发。本文系统性地调查了流行的开源 LLM 在不同符号推理任务上的能力与局限性。我们对 Llama 2 系列的三个模型在两个需要解决难度程度不同的数学公式的数据集上进行评估。我们测试了通用型 LLM(Llama 2 Chat)以及两个针对数学问题专门设计的微调版 Llama 2(MAmmoTH 和 MetaMath)。我们观察到,模型规模的增加和针对相关任务的微调都导致显著的性能提升。此外,借助细粒度评估措施,我们发现这些性能提升主要出现在难度较低的数学公式上,而这些公式即便是对于最大的微调模型来说也常常具有挑战性。
引用
@article{arxiv.2406.06588,
title = {Assessing the Emergent Symbolic Reasoning Abilities of Llama Large Language Models},
author = {Flavio Petruzzellis and Alberto Testolin and Alessandro Sperduti},
journal= {arXiv preprint arXiv:2406.06588},
year = {2024}
}
备注
Accepted at 33rd International Conference on Artificial Neural Networks (ICANN24)