中文

RevFFN:基于可逆块实现混合专家 LLMs 的内存高效全参数微调

机器学习 2025-12-25 v1 人工智能

摘要

全参数微调是适应大语言模型(LLM)以应对下游任务的关键技术,但由于需要缓存大量中间激活以进行反向传播,导致巨大的内存开销。这种瓶颈使得对当代大规模 LLMs 进行全参数微调在实际中具有挑战性。现有的分布式训练框架如 DeepSpeed 通过 ZeRO 和 FSDP 等技术来缓解此问题,这些技术依赖多 GPU 内存或 CPU 卸载,但常需额外的硬件资源且会降低训练速度。我们提出 RevFFN,一种面向混合专家(MoE) LLMs 的内存高效微调范式。RevFFN 采用精心设计的可逆 Transformer 块,允许在反向传播期间从输出重构出层输入激活,从而无需在内存中存储大多数中间激活。虽然保持 MoE 架构的表达能力,本方法显著降低了全参数微调的峰值内存消耗。因此,RevFFN 使在单个消费级或服务器级 GPU 上进行高效全参数微调成为可能。

关键词

引用

@article{arxiv.2512.20920,
  title  = {RevFFN: Memory-Efficient Full-Parameter Fine-Tuning of Mixture-of-Experts LLMs with Reversible Blocks},
  author = {Ningyuan Liu and Jing Yang and Kaitong Cai and Keze Wang},
  journal= {arXiv preprint arXiv:2512.20920},
  year   = {2025}
}

备注

Under submission