中文

NeMo-Aligner:面向高效模型对齐的可扩展工具包

计算与语言 2024-09-04 v2 人工智能 机器学习

摘要

将大型语言模型(LLM)与人类价值观和偏好对齐对于使其有用且安全至关重要。然而,构建执行对齐的高效工具可能具有挑战性,特别是对于通常包含数百亿或数千亿参数的最大且能力最强的 LLM。我们创建了 NeMo-Aligner,这是一个模型对齐工具包,能够高效扩展至一千个 GPU,用于训练 Nemotron 4 340B 和 Llama 3.1 405B 等最大的开源 LLM。NeMo-Aligner 为模型对齐的主要范式提供了高度优化且可扩展的实现,例如:基于人类反馈的强化学习(RLHF)、直接偏好优化(DPO)、SteerLM 和自博弈微调(SPIN)。此外,我们的工具包支持在参数高效微调(PEFT)设置下运行大多数对齐技术。NeMo-Aligner 专为可扩展性而设计,允许以极少的精力支持其他对齐技术。它采用 Apache 2.0 许可证开源,我们邀请社区在 https://github.com/NVIDIA/NeMo-Aligner 参与贡献

关键词

引用

@article{arxiv.2405.01481,
  title  = {NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment},
  author = {Gerald Shen and Zhilin Wang and Olivier Delalleau and Jiaqi Zeng and Yi Dong and Daniel Egert and Shengyang Sun and Jimmy Zhang and Sahil Jain and Ali Taghibakhshi and Markel Sanz Ausin and Ashwath Aithal and Oleksii Kuchaiev},
  journal= {arXiv preprint arXiv:2405.01481},
  year   = {2024}
}

备注

16 pages, 4 figures, Accepted to COLM 2024