基于 LLM 操作足迹的收敛架构调查与评估
机器学习
2025-07-16 v1 人工智能
计算与语言
摘要
注意力机制和Transformer架构的出现,使得上下文自然文本生成成为可能,并将处理整个源信息的负担压缩为单个向量。基于这两大思想,模型规模逐渐增大,以容纳更精确和更全面的信息,导致当前最先进的大语言模型(LLM)参数规模达到约700亿。随着模型规模的增长,对大量存储和计算容量的需求也随之增加,这推动了高带宽内存和加速器的开发,以及各种为满足这些要求而设计的模型架构。我们注意到,LLM架构正趋于日益收敛。本文在考察各种超参数设置的情况下,分析这些收敛架构在层配置、操作机制和模型规模方面的表现。本文通过追溯 LLM 操作改进的演变历史,进行一次简洁的历史调查。此外,我们使用配备最新Ada Lovelace架构的RTX 6000,对 LLM 在各种超参数设置下的性能趋势进行总结。我们得出结论,即使是相同的模型,在超参数或是否部署在服务器或边缘环境的情况下,也会表现出不同的行为。
引用
@article{arxiv.2410.11381,
title = {Survey and Evaluation of Converging Architecture in LLMs based on Footsteps of Operations},
author = {Seongho Kim and Jihyun Moon and Juntaek Oh and Insu Choi and Joon-Sung Yang},
journal= {arXiv preprint arXiv:2410.11381},
year = {2025}
}
备注
13 pages and 16 figures