中文

LLM-as-a-Judge 与奖励模型:它们能做什么和不能做什么

计算与语言 2024-10-03 v2

摘要

LLM-as-a-Judge和奖励模型是评估大语言模型(LLM)的替代方法,常用于替代多选题或人类标注员。在评估长形式回答方面,其效果尤为突出,作为评估排行榜的关键评估者,以及通过强化学习对齐LLM的代理角色尤为关键。然而,尽管其流行度日益提升,但其在多样化情境中的有效性,如非英文提示、事实验证或具有挑战性的问题,仍未得到探索。本文对自动化评估器进行了全面分析,报告了若干关键发现。首先,我们发现英文评估能力显著影响语言特定评估能力,往往超过语言熟练程度本身,这使得在英文中训练的评估器能够轻松地将其技能迁移到其他语言。其次,我们识别出关键短板,LLM在检测和惩罚错误方面如事实不准确、文化误代表达以及不必要语言的存在时会失败。最后,我们发现最先进的评估器在挑战性提示下(无论是英文还是韩文)都难以应对,这凸显了其在评估或生成复杂推理问题方面的局限性。我们公开了所使用的dataset和代码。

关键词

引用

@article{arxiv.2409.11239,
  title  = {LLM-as-a-Judge & Reward Model: What They Can and Cannot Do},
  author = {Guijin Son and Hyunwoo Ko and Hoyoung Lee and Yewon Kim and Seunghyeok Hong},
  journal= {arXiv preprint arXiv:2409.11239},
  year   = {2024}
}

备注

under review