中文

Arena Learning:通过模拟聊天机器人竞技场构建LLM后训练数据飞轮

计算与语言 2024-07-16 v1 人工智能 机器学习

摘要

评估大语言模型(LLM)的效果提出了重大挑战。在线聊天机器人竞技场进行人工标注对战是高效的评估方法,但受限于人工标注的成本与时间。在本文中,我们引入Arena Learning—a一种创新的离线策略,通过AI驱动的标注模拟这些竞技场对战,以评估战果并通过监督微调与强化学习持续改进目标模型。Arena Learning包含两个关键要素:其一,通过WizardArena管道实现精准评估,维持离线模拟与线上竞技之间的一致性。该管道通过精心设计的离线测试集准确预测各种模型的Elo排名。我们的实验表明,WizardArena的预测与线上竞技结果高度一致。其二,基于对战结果持续改进训练数据。我们建立数据飞轮,不断通过突出目标模型弱点的对战结果,来更新训练数据,使其学习来自多个不同模型的优势。我们将Arena Learning应用于训练目标模型WizardLM-β\beta,并在各项指标上实现显著性能提升。这一完全自动的训练与评估管道为通过后训练在各类LLM上实现持续进步奠定了基础。值得注意的是,Arena Learning在WizardLM-2取得成功中起到了关键作用,本文既是对其有效性的探索,也是针对WizardLM-2及其衍生模型的基础性研究。

关键词

引用

@article{arxiv.2407.10627,
  title  = {Arena Learning: Build Data Flywheel for LLMs Post-training via Simulated Chatbot Arena},
  author = {Haipeng Luo and Qingfeng Sun and Can Xu and Pu Zhao and Qingwei Lin and Jianguang Lou and Shifeng Chen and Yansong Tang and Weizhu Chen},
  journal= {arXiv preprint arXiv:2407.10627},
  year   = {2024}
}