理解与缓解 LLM RLHF 中的内存消耗
机器学习
2024-10-22 v1
摘要
使用强化学习与人类反馈 (RLHF) 对大型语言模型 (LLM) 进行微调是对齐的关键步骤。然而,RLHF 常常面临显著的内存挑战。本研究是首次在 RLHF 语境中考察内存用量,探索各种内存管理策略,揭示过度内存消耗的原因。此外,我们引入一种简单而有效的方法,显著降低 RLHF 微调所需的内存。
引用
@article{arxiv.2410.15651,
title = {Understanding and Alleviating Memory Consumption in RLHF for LLMs},
author = {Jin Zhou and Hanmei Yang and Steven and Tang and Mingcan Xiang and Hui Guan and Tongping Liu},
journal= {arXiv preprint arXiv:2410.15651},
year = {2024}
}