缩放对大型语言模型内功能层次的涌现效应
计算与语言
2025-01-14 v1 人工智能
摘要
大型语言模型(LLM)架构通常被描述为功能层次化:早期层处理句法,中间层开始解析语义,后期层整合信息。本文重新审视这些观点。研究向LLM提交简单文本(如“A church and organ”)并提取激活值。然后,对每一层,拟合支持向量机和岭回归来预测文本标签,从而检查给定层是否编码某些信息。使用小模型(Llama-3.2-3b; 28层)的分析部分支持了常见的层次观点:项目级语义在早期层(2-7)最强,然后是两个项目关系(8-12层),然后四个项目类比(10-15层)。之后,项目和简单关系的表示在更深层逐渐减少,这些层专注于更全局的信息。然而,一些发现与稳定层次观点相悖:首先,尽管深层可以表示文档范围的抽象,但深层也会压缩上下文窗口早期部分的信息而没有有意义的抽象。其次,当检查更大模型(Llama-3.3-70b-Instruct)时,抽象水平出现剧烈波动:随着深度增加,两个项目关系和四个项目类比的表示先增加,然后显著减少,之后再次短暂增加。这种奇特模式在多个实验中一致出现。第三,缩放的另一个涌现效应是相邻层注意力机制之间的协调。在使用更大模型的多个实验中,相邻层在它们各自专门表示的信息之间波动。总之,抽象层次通常跨层显现,但大型模型也以奇特方式偏离这种结构。
引用
@article{arxiv.2501.07359,
title = {Emergent effects of scaling on the functional hierarchies within large language models},
author = {Paul C. Bogdan},
journal= {arXiv preprint arXiv:2501.07359},
year = {2025}
}