Baichuan对齐技术报告
机器学习
2024-12-30 v4 计算与语言
摘要
我们介绍了Baichuan对齐,这是对Baichuan系列模型中采用的对齐技术的详细分析。这代表了业界首次全面阐述对齐方法论,为推进AI研究提供了宝贵的见解。我们研究了在对齐过程中提升模型性能的关键组成部分,包括优化方法、数据策略、能力增强和评估过程。该过程涵盖三个关键阶段:提示增强系统(PAS)、监督微调(SFT)和偏好对齐。所遇到的问题、应用的解决方案以及所做的改进都被详细记录。通过在公认基准上的比较,我们突出了Baichuan对齐所实现的技术进步。Baichuan-Instruct是一个内部模型,而Qwen2-Nova-72B和Llama3-PBM-Nova-70B是通过Baichuan对齐优化的Qwen2-72B和Llama-3-70B基础模型的指令版本。Baichuan-Instruct在核心能力上表现出显著改进,用户体验提升幅度从17%到28%,并在专业基准上表现异常出色。在开源基准评估中,Qwen2-Nova-72B和Llama3-PBM-Nova-70B在几乎所有数据集上始终优于它们各自官方的指令版本。本报告旨在阐明对齐过程背后的关键技术,促进社区更深入的理解。Llama3-PBM-Nova-70B模型可在https://huggingface.co/PKU-Baichuan-MLSystemLab/Llama3-PBM-Nova-70B获取。
引用
@article{arxiv.2410.14940,
title = {Baichuan Alignment Technical Report},
author = {Mingan Lin and Fan Yang and Yanjun Shen and Haoze Sun and Tianpeng Li and Tao Zhang and Chenzheng Zhu and Tao Zhang and Miao Zheng and Xu Li and Yijie Zhou and Mingyang Chen and Yanzhao Qin and Youquan Li and Hao Liang and Fei Li and Yadong Li and Mang Wang and Guosheng Dong and Kun Fang and Jianhua Xu and Bin Cui and Wentao Zhang and Zenan Zhou and Weipeng Chen},
journal= {arXiv preprint arXiv:2410.14940},
year = {2024}
}