中文

MatFormer:用于弹性推理的嵌套 Transformer

机器学习 2024-12-17 v2 计算与语言 计算机视觉与模式识别

摘要

基础模型被应用于从大规模多加速器集群到资源受限的独立移动设备等具有不同推理约束的广泛场景中。然而,训练这些模型的巨大成本常限制了可提供的独特模型尺寸数量。因此,实践者被迫选择可能未与其特定延迟和成本需求最优对齐的模型。我们提出 MatFormer,一种新颖的 Transformer 架构,旨在为多样部署约束提供弹性推理。MatFormer 通过在标准 Transformer 模型中引入嵌套前馈网络(FFN)块结构来实现这一点。在训练期间,我们优化多个不同尺寸的嵌套 FFN 块的参数,使得无需额外计算成本即可提取数百个精确的小模型。我们在不同模型类别(解码器与编码器)和模态(语言与视觉)上实证验证了 MatFormer 的有效性,展示了其在实际部署中的潜力。我们表明,一个 850M 仅解码器 MatFormer 语言模型(MatLM)允许我们提取多个从 582M 到 850M 参数不等的小模型,每个在验证损失和一次性下游评估上均优于独立训练的对应模型。此外,我们观察到从基于通用 MatFormer 的 ViT(MatViT)编码器提取的较小编码器保留了用于自适应大规模检索的度量空间结构。最后,我们展示了利用从 MatFormer 提取的精确且一致的子模型进行推测解码可显著减少推理延迟。项目网站:https://devvrit.github.io/matformer/

关键词

引用

@article{arxiv.2310.07707,
  title  = {MatFormer: Nested Transformer for Elastic Inference},
  author = {Devvrit and Sneha Kudugunta and Aditya Kusupati and Tim Dettmers and Kaifeng Chen and Inderjit Dhillon and Yulia Tsvetkov and Hannaneh Hajishirzi and Sham Kakade and Ali Farhadi and Prateek Jain},
  journal= {arXiv preprint arXiv:2310.07707},
  year   = {2024}
}

备注

30 pages, 11 figures, first three authors contributed equally. NeurIPS, 2024