中文

更大更深就一定更好吗?跨规模和层探测LLaMA

计算与语言 2024-01-10 v4

摘要

本文对大型语言模型(LLMs)进行了深入分析,重点关注LLaMA——自然语言处理中一个重要的开源基础模型。我们并非通过其生成输出来评估LLaMA,而是设计多项选择任务来探测其在推理和计算等高级任务中的内在理解。我们横向比较不同规模的模型,纵向评估不同层。基于设计的探测任务,我们揭示了几项关键且不常见的发现:(1)横向来看,扩大模型规模几乎不能自动赋予额外的知识或计算能力。相反,它可以增强推理能力,尤其是在数学问题求解方面,并有助于减少幻觉,但仅当超过一定规模阈值时;(2)在纵向分析中,LLaMA的低层缺乏实质性的算术和事实知识,但展现出逻辑思维、多语言和识别能力,而顶层则拥有大部分计算能力和现实世界知识。

关键词

引用

@article{arxiv.2312.04333,
  title  = {Is Bigger and Deeper Always Better? Probing LLaMA Across Scales and Layers},
  author = {Nuo Chen and Ning Wu and Shining Liang and Ming Gong and Linjun Shou and Dongmei Zhang and Jia Li},
  journal= {arXiv preprint arXiv:2312.04333},
  year   = {2024}
}

备注

15 pages