自适应秩分配:通过 RaNA 适配器加速现代变压器
机器学习
2025-05-08 v2
摘要
大型语言模型(LLMs)在推理期间计算密集,尤其是对于现代变压器。 神经元自适应技术通过选择性激活多层感知器(MLP)层中的神经元,提供了一些加速,但在现代变压器中存在局限性。 这些局限性包括对稀疏激活的依赖、与注意力层不兼容以及使用成本高昂的神经元掩码技术。 为了解决这些问题,我们提出了自适应秩分配框架并引入了秩和神经元分配器(RaNA)适配器。 RaNA 适配器利用秩适配器,这些适配器通过对线性层应用低秩矩阵分解和自适应掩码来高效分配计算资源,而无需依赖激活稀疏性。这使 RaNA 可以普遍应用于 MLP 和注意力模块的线性组件,同时消除神经自适应方法中昂贵掩码器的需求。 值得注意的是,与神经元适配器相比,RaNA 在降低约 44% FLOPs 的情况下,提高了困惑度最高可提升 7 分,并在准确率上提高最高可达 8 个百分点。 这些结果将 RaNA 定位为改进现代变压器架构推理效率的稳健解决方案。
引用
@article{arxiv.2503.18216,
title = {Adaptive Rank Allocation: Speeding Up Modern Transformers with RaNA Adapters},
author = {Roberto Garcia and Jerry Liu and Daniel Sorvisto and Sabri Eyuboglu},
journal= {arXiv preprint arXiv:2503.18216},
year = {2025}
}
备注
16 pages, 5 figures. ICLR 2025