中文

可配置基础模型:从模块化视角构建 LLM

人工智能 2024-09-05 v1 计算与语言 机器学习

摘要

LLM 的最新进展揭示了与其庞大参数量需求相关的计算效率与持续可扩展性挑战,使得这些模型在计算资源受限的设备上以及需要多种能力的场景中的应用与演化日益繁琐。受人脑模块化特性的启发,将 LLM 分解为众多功能模块的趋势日益增长,允许仅使用部分模块进行推理并动态组装模块以处理复杂任务,例如混合专家。为了突出模块化方法固有的效率与可组合性,我们提出用“砖块”一词来表示每个功能模块,并将这种模块化结构命名为可配置基础模型。在本文中,我们对可配置基础模型的构建、利用与局限性进行了全面的概述与研究。我们首先将模块形式化为涌现砖块——在预训练阶段涌现的功能神经元分区,以及定制砖块——通过额外的后训练构建以提升 LLM 能力与知识的砖块。基于多样的功能砖块,我们进一步提出了四种面向砖块的操作:检索与路由、合并、更新和生长。这些操作允许根据指令动态配置 LLM 以处理复杂任务。为了验证我们的观点,我们对广泛使用的 LLM 进行了实证分析。我们发现 FFN 层遵循模块化模式,具有神经元功能特化与功能神经元分区。最后,我们强调了若干开放性问题与未来研究方向。总体而言,本文旨在为现有 LLM 研究提供全新的模块化视角,并启发未来构建更高效、更具可扩展性的基础模型。

关键词

引用

@article{arxiv.2409.02877,
  title  = {Configurable Foundation Models: Building LLMs from a Modular Perspective},
  author = {Chaojun Xiao and Zhengyan Zhang and Chenyang Song and Dazhi Jiang and Feng Yao and Xu Han and Xiaozhi Wang and Shuo Wang and Yufei Huang and Guanyu Lin and Yingfa Chen and Weilin Zhao and Yuge Tu and Zexuan Zhong and Ao Zhang and Chenglei Si and Khai Hao Moo and Chenyang Zhao and Huimin Chen and Yankai Lin and Zhiyuan Liu and Jingbo Shang and Maosong Sun},
  journal= {arXiv preprint arXiv:2409.02877},
  year   = {2024}
}