中文

探究大语言模型的符号能力

计算与语言 2024-05-24 v1 机器学习

摘要

提示技术显著增强了大语言模型(LLM)在各种复杂任务中的能力,包括推理、规划和解决数学应用题。然而,大多数研究主要集中在基于语言的推理和文字问题上,往往忽视了LLM在处理基于符号的计算和推理方面的潜力。本研究旨在通过在一系列符号任务(如加法、乘法、模运算、数值精度和符号计数)上严格评估LLM来弥合这一差距。我们的分析涵盖了八个LLM,包括四个企业级和四个开源模型,其中三个已在数学任务上进行了预训练。评估框架基于乔姆斯基层级,为这些模型的计算能力提供了稳健的度量。评估采用了最小解释提示与零样本链式思考技术相结合,使模型能够自主导航求解过程。研究结果揭示了LLM在上下文无关和上下文敏感符号任务上的性能随着符号数量所代表的复杂性增加而显著下降。值得注意的是,即使是微调的GPT3.5也只表现出边际改进,与其他模型观察到的性能趋势一致。总体而言,所有模型在这些符号密集型任务上都表现出有限的泛化能力。这项研究强调了LLM在应对日益增长的符号复杂性方面的挑战,并强调了需要专门的训练、记忆和架构调整来提高它们在基于符号的推理任务中的熟练程度。

关键词

引用

@article{arxiv.2405.13209,
  title  = {Investigating Symbolic Capabilities of Large Language Models},
  author = {Neisarg Dave and Daniel Kifer and C. Lee Giles and Ankur Mali},
  journal= {arXiv preprint arXiv:2405.13209},
  year   = {2024}
}