Arena Learning:通过模拟聊天机器人竞技场构建LLM后训练数据飞轮
计算与语言
2024-07-16 v1 人工智能
机器学习
摘要
评估大语言模型(LLM)的效果提出了重大挑战。在线聊天机器人竞技场进行人工标注对战是高效的评估方法,但受限于人工标注的成本与时间。在本文中,我们引入Arena Learning—a一种创新的离线策略,通过AI驱动的标注模拟这些竞技场对战,以评估战果并通过监督微调与强化学习持续改进目标模型。Arena Learning包含两个关键要素:其一,通过WizardArena管道实现精准评估,维持离线模拟与线上竞技之间的一致性。该管道通过精心设计的离线测试集准确预测各种模型的Elo排名。我们的实验表明,WizardArena的预测与线上竞技结果高度一致。其二,基于对战结果持续改进训练数据。我们建立数据飞轮,不断通过突出目标模型弱点的对战结果,来更新训练数据,使其学习来自多个不同模型的优势。我们将Arena Learning应用于训练目标模型WizardLM-,并在各项指标上实现显著性能提升。这一完全自动的训练与评估管道为通过后训练在各类LLM上实现持续进步奠定了基础。值得注意的是,Arena Learning在WizardLM-2取得成功中起到了关键作用,本文既是对其有效性的探索,也是针对WizardLM-2及其衍生模型的基础性研究。
关键词
引用
@article{arxiv.2407.10627,
title = {Arena Learning: Build Data Flywheel for LLMs Post-training via Simulated Chatbot Arena},
author = {Haipeng Luo and Qingfeng Sun and Can Xu and Pu Zhao and Qingwei Lin and Jianguang Lou and Shifeng Chen and Yansong Tang and Weizhu Chen},
journal= {arXiv preprint arXiv:2407.10627},
year = {2024}
}