Okapi:基于人类反馈强化学习的多语言指令微调大语言模型
计算与语言
2023-08-03 v2 机器学习
摘要
大语言模型(LLMs)发展的关键技术之一是指令微调,其有助于将模型的响应与人类期望对齐,从而实现令人惊叹的学习能力。指令微调的两大主要方法是监督微调(SFT)和基于人类反馈的强化学习(RLHF),目前已被用于生成最佳的商业 LLMs(如 ChatGPT)。为提高 LLMs 对研发工作的可及性,近期也推出了各种指令微调的开源 LLM,例如 Alpaca、Vicuna 等。然而,现有的开源 LLM 仅针对英语和少数流行语言进行了指令微调,从而阻碍了其影响力及对世界上许多其他语言的可及性。在少数探索多语言 LLM 指令微调的最新工作中,SFT 被用作对多语言 LLM 进行指令微调的唯一方法。这为基于 RLHF 的多样化语言微调 LLM 留下了显著空白,并提出了 RLHF 如何提升多语言指令微调性能的重要问题。为克服该问题,我们提出 Okapi,首个基于 RLHF 的多语言指令微调 LLM 系统。Okapi 引入了 26 种多样化语言的指令与响应排序数据,以促进未来多语言 LLM 研究的实验与开发。我们还提出了基准数据集,以实现对多语言生成式 LLM 的评估。我们的实验证明了 RLHF 相对于 SFT 在不同基础模型与数据集上的多语言指令优势。我们的框架与资源发布于 https://github.com/nlp-uoregon/Okapi。
引用
@article{arxiv.2307.16039,
title = {Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback},
author = {Viet Dac Lai and Chien Van Nguyen and Nghia Trung Ngo and Thuat Nguyen and Franck Dernoncourt and Ryan A. Rossi and Thien Huu Nguyen},
journal= {arXiv preprint arXiv:2307.16039},
year = {2023}
}