中文

元奖励语言模型:基于 LLM 作为元评判家的自我改进对齐

计算与语言 2024-07-31 v2 人工智能

摘要

大型语言模型 (LLM) 正在多个领域超越人类知识水平。虽然改进这些模型通常依赖昂贵的人类数据,但最近的自奖励机制 (Yuan 等,2024) 显示 LLM 可以通过评判自身响应来实现改进,而无需依赖人类标注员。然而,现有方法主要聚焦于改进模型响应,而非评判能力,导致迭代训练过程中快速饱和。为此,我们引入一种新的 Meta-Rewarding 步骤到自我改进过程中,模型对自身评判进行评判,并利用该反馈细化其评判技能。令人惊讶的是,这种无监督方法显著提升了模型的评判能力和指令遵循能力。 Llama-3-8B-Instruct 在 AlpacaEval 2 上的获胜率从 22.9% 提升至 39.4%,在 Arena-Hard 上的获胜率从 20.6% 提升至 29.1%。这些结果强有力地表明了无需人工监督即可实现模型自我改进的潜力。

关键词

引用

@article{arxiv.2407.19594,
  title  = {Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge},
  author = {Tianhao Wu and Weizhe Yuan and Olga Golovneva and Jing Xu and Yuandong Tian and Jiantao Jiao and Jason Weston and Sainbayar Sukhbaatar},
  journal= {arXiv preprint arXiv:2407.19594},
  year   = {2024}
}