用于轻量级大语言模型API调用代码生成的RLAIF方法
计算与语言
2024-07-01 v1
摘要
强化学习从AI反馈(RLAIF)在各个领域展现出巨大的潜力,包括缓解大语言模型输出中的有害内容、提升文本摘要质量以及增强数学推理能力。本文提出一种用于改进轻量级(参数不足10亿)大语言模型代码生成能力的RLAIF框架。我们特别关注需要编写合适API调用的代码生成任务,这类任务在大语言模型中因幻觉问题而具有挑战性。我们的框架通过专门的提示策略从较大的大语言模型(如GPT-3.5)中提取AI反馈,并利用此数据训练奖励模型,以实现对更小规模大语言模型的更好对齐。我们在Gorilla数据集上运行实验,并仔细评估了模型生成代码在各种指标上的质量,包括AST、ROUGE和Code-BLEU,同时开发了一种准确计算其可执行性比率的管道。我们的方法显著提升了微调大语言模型基线的性能,使可执行性比率提升4.5%。值得注意的是,使用RLAIF训练的较小大语言模型(7.8亿参数)能够超越参数量为70亿的较大微调基线,实现1.0%的更高代码可执行性比率。
引用
@article{arxiv.2406.20060,
title = {Applying RLAIF for Code Generation with API-usage in Lightweight LLMs},
author = {Sujan Dutta and Sayantan Mahinder and Raviteja Anantha and Bortik Bandyopadhyay},
journal= {arXiv preprint arXiv:2406.20060},
year = {2024}
}