中文

Flextron:灵活的大型语言模型

计算与语言 2024-08-29 v2 机器学习

摘要

训练现代大型语言模型(LLM)需要极其资源密集的计算资源,通过反复训练来针对计算和内存资源有限的各种部署场景进行定制化是不可行的。本文介绍了 Flextron,这是一个支持灵活模型部署的网络架构和后训练模型优化框架。Flextron 架构利用嵌套弹性结构,能够在推理期间快速适应特定的用户定义的延迟和准确率目标,无需额外的微调。它也是输入自适应的,可以自动将 token 通过其子网络进行路由,以实现更好的性能和效率。我们present了一种样本高效的训练方法和相关路由算法,用于系统性地将现有的训练好的 LLM 转换为 Flextron 模型。我们在 GPT-3 和 LLama-2 系列大型语言模型上对 Flextron 进行评估,证明其在多个端到端训练变体和其他最先进的弹性网络之上都表现出优异性能,所有这些都只需要一次预训练,耗费的 token 数量仅为原始预训练的 7.63%。

关键词

引用

@article{arxiv.2406.10260,
  title  = {Flextron: Many-in-One Flexible Large Language Model},
  author = {Ruisi Cai and Saurav Muralidharan and Greg Heinrich and Hongxu Yin and Zhangyang Wang and Jan Kautz and Pavlo Molchanov},
  journal= {arXiv preprint arXiv:2406.10260},
  year   = {2024}
}