中文

FlexRank:用于自适应模型部署的嵌套低秩知识分解

机器学习 2026-02-04 v1

摘要

深度神经网络的规模不断扩大,涵盖大型语言模型 (LLM) 和视觉转换器 (ViT),使得从头训练成本高昂且部署日益昂贵。这些模型常被用作具有固定成本的计算单体,这种刚性方法未能充分利用过参数化架构,也严重阻碍了在不同成本预算下的自适应部署。我们认为,可以从预训练模型中提取按重要性排序的嵌套组件,并根据可用计算资源有选择地激活它们。为此,我们提出的 FlexRank 方法利用低秩权重分解结合基于重要性的嵌套合并,从而提取出逐步提升性能的子模型。我们的 методology 实施了“一次训练,处处部署”的范式,能够在不为每个预算从头训练的情况下,在成本与性能之间提供优雅的权衡——推动大型模型的实际部署。

关键词

引用

@article{arxiv.2602.02680,
  title  = {FlexRank: Nested Low-Rank Knowledge Decomposition for Adaptive Model Deployment},
  author = {Riccardo Zaccone and Stefanos Laskaridis and Marco Ciccone and Samuel Horváth},
  journal= {arXiv preprint arXiv:2602.02680},
  year   = {2026}
}