RNR:教会大语言模型遵循角色与规则
计算与语言
2024-09-24 v1 人工智能
人机交互
摘要
指令微调(IFT)通过监督学习来激发指令遵循能力,通过引导大语言模型(LLM)的行为。然而,现有的模型在开源IFT数据集上训练的模型仅具备遵循用户指令的能力,往往无法遵循开发者指定的复杂角色和规则(即系统提示)。遵循这些角色和规则的能力对于部署至关重要,因为它确保模型在开发者定义的指南内安全地与用户交互。为提高此类角色和规则遵循能力,我们提出了一种名为\model的自动化数据生成管道,该管道从现有IFT指令中生成多样化的角色和规则,以及相应的响应。这类数据可用于训练遵循复杂系统提示的模型。我们在我们新创建的角色和规则遵循基准测试以及标准指令遵循基准测试和通用NLP任务上对模型进行了评估。我们的框架在LLM的角色和规则遵循能力方面实现了显著提升,证据表明,在Alpaca和Ultrachat数据集上,我们的实验中在规则遵循(即遵循所有要求)通过率提高了25%以上。此外,我们的模型在不出现任何流行指令遵循基准测试退步的情况下实现了此项提升。
引用
@article{arxiv.2409.13733,
title = {RNR: Teaching Large Language Models to Follow Roles and Rules},
author = {Kuan Wang and Alexander Bukharin and Haoming Jiang and Qingyu Yin and Zhengyang Wang and Tuo Zhao and Jingbo Shang and Chao Zhang and Bing Yin and Xian Li and Jianshu Chen and Shiyang Li},
journal= {arXiv preprint arXiv:2409.13733},
year = {2024}
}