FlexRank:用于自适应模型部署的嵌套低秩知识分解
机器学习
2026-02-04 v1
摘要
深度神经网络的规模不断扩大,涵盖大型语言模型 (LLM) 和视觉转换器 (ViT),使得从头训练成本高昂且部署日益昂贵。这些模型常被用作具有固定成本的计算单体,这种刚性方法未能充分利用过参数化架构,也严重阻碍了在不同成本预算下的自适应部署。我们认为,可以从预训练模型中提取按重要性排序的嵌套组件,并根据可用计算资源有选择地激活它们。为此,我们提出的 FlexRank 方法利用低秩权重分解结合基于重要性的嵌套合并,从而提取出逐步提升性能的子模型。我们的 методology 实施了“一次训练,处处部署”的范式,能够在不为每个预算从头训练的情况下,在成本与性能之间提供优雅的权衡——推动大型模型的实际部署。
引用
@article{arxiv.2602.02680,
title = {FlexRank: Nested Low-Rank Knowledge Decomposition for Adaptive Model Deployment},
author = {Riccardo Zaccone and Stefanos Laskaridis and Marco Ciccone and Samuel Horváth},
journal= {arXiv preprint arXiv:2602.02680},
year = {2026}
}