中文

ChunkFT:面向内存高效完整微调的字节流式优化

机器学习 2026-05-21 v1 计算与语言

摘要

本文提出了 ChunkFT—a一种内存高效的微调框架,通过动态激活的工作子集来重新构建完整参数微调。ChunkFT 能够在不修改网络架构的前提下,对任意子张量进行梯度计算,为优化任意子网络提供算法基础,避免了标准稠密梯度计算。我们在确定性情形下对 ChunkFT 提供了理论收敛分析。实验方面,我们将 ChunkFT 应用于 Llama 3-8B 和 Llama 3-70B 的微调,分别使用单张 RTX 4090-24GB GPU 和 2× H800-80GB GPU。完整参数微调 7B 模型(输入长度为 1K)仅需 13.72GB GPU 内存。结果表明,ChunkFT 在内存占用、运行时间和优化质量方面均表现出色。此外,针对语言理解、数学推理和 MT-Bench 等下游任务评估显示,ChunkFT 在所有内存高效基线中均表现出优异,甚至在某些情况下超过完整参数微调。我们的仓库已公开于 https://github.com/misonsky/chunk。

关键词

引用

@article{arxiv.2605.21177,
  title  = {ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning},
  author = {Yongkang Liu and Zijing Wang and Mengjie Zhao and Ercong Nie and Mingyang Wang and Qian Li and Feiliang Ren and Shi Feng and Daling Wang and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2605.21177},
  year   = {2026}
}